आपका पहला BOW
Bag-of-words टेक्स्ट को न्यूमेरिक रूप में बदलने का एक तरीका है.
इस अभ्यास में, आप अगले अभ्यास में बड़े डेटासेट पर जाने से पहले annak लिस्ट पर BOW लागू करेंगे.
आपका काम है इस लिस्ट के साथ काम करना और CountVectorizer() का उपयोग करके BOW लागू करना. यह ट्रांसफॉर्मेशन किसी टेक्स्ट की सेंटिमेंट को समझने की आपकी पहली सीढ़ी है. उन शब्दों पर ध्यान दीजिए जो तेज़/मज़बूत सेंटिमेंट दर्शा सकते हैं.
याद रखें कि CountVectorizer() का आउटपुट एक स्पार्स मैट्रिक्स होता है, जो सिर्फ़ नॉन-ज़ीरो एंट्रीज़ को स्टोर करता है. इस मैट्रिक्स की असल सामग्री देखने के लिए, हम .toarray() मेथड का उपयोग करके इसे डेंस एरे में बदलते हैं.
ध्यान दें कि इस मामले में आपको max_features आर्ग्युमेंट बताने की ज़रूरत नहीं है, क्योंकि टेक्स्ट छोटा है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Sentiment Analysis
अभ्यास निर्देश
sklearn.feature_extraction.textसे count vectorizer फंक्शन इम्पोर्ट करें.- छोटे डेटासेट पर वेक्टराइज़र को बनाएँ और फिट करें.
transform()मेथड कॉल करकेanna_bowनाम से BOW निरूपण बनाइए.- BOW परिणाम को डेंस एरे के रूप में प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())