शुरू करेंमुफ़्त में शुरू करें

आपका पहला BOW

Bag-of-words टेक्स्ट को न्यूमेरिक रूप में बदलने का एक तरीका है.

इस अभ्यास में, आप अगले अभ्यास में बड़े डेटासेट पर जाने से पहले annak लिस्ट पर BOW लागू करेंगे.

आपका काम है इस लिस्ट के साथ काम करना और CountVectorizer() का उपयोग करके BOW लागू करना. यह ट्रांसफॉर्मेशन किसी टेक्स्ट की सेंटिमेंट को समझने की आपकी पहली सीढ़ी है. उन शब्दों पर ध्यान दीजिए जो तेज़/मज़बूत सेंटिमेंट दर्शा सकते हैं.

याद रखें कि CountVectorizer() का आउटपुट एक स्पार्स मैट्रिक्स होता है, जो सिर्फ़ नॉन-ज़ीरो एंट्रीज़ को स्टोर करता है. इस मैट्रिक्स की असल सामग्री देखने के लिए, हम .toarray() मेथड का उपयोग करके इसे डेंस एरे में बदलते हैं.

ध्यान दें कि इस मामले में आपको max_features आर्ग्युमेंट बताने की ज़रूरत नहीं है, क्योंकि टेक्स्ट छोटा है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn.feature_extraction.text से count vectorizer फंक्शन इम्पोर्ट करें.
  • छोटे डेटासेट पर वेक्टराइज़र को बनाएँ और फिट करें.
  • transform() मेथड कॉल करके anna_bow नाम से BOW निरूपण बनाइए.
  • BOW परिणाम को डेंस एरे के रूप में प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
कोड संपादित करें और चलाएँ