शुरू करेंमुफ़्त में शुरू करें

प्रोडक्ट रिव्यूज़ पर BOW

आपने एक छोटे डेटासेट पर BOW का अभ्यास किया था. अब आप इसे Amazon प्रोडक्ट रिव्यूज़ के एक सैंपल पर लागू करेंगे. डेटा आपके लिए इम्पोर्ट कर दिया गया है और उसका नाम reviews है. इसमें दो कॉलम हैं. पहला score कहलाता है और जब रिव्यू नेगेटिव हो तो यह 0 होता है, और पॉजिटिव होने पर 1. दूसरा कॉलम review है और इसमें कस्टमर द्वारा लिखा गया रिव्यू टेक्स्ट होता है. IPython Shell में डेटा को बेझिझक एक्सप्लोर कीजिए.

आपका काम review कॉलम का उपयोग करके BOW vocabulary बनाना है.

याद रखिए कि vocabulary के सभी एलिमेंट्स की सूची पाने के लिए हम vectorizer पर .get_feature_names() मेथड कॉल कर सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • अधिकतम फीचर्स की संख्या निर्धारित करते हुए एक CountVectorizer ऑब्जेक्ट बनाएँ.
  • vectorizer को fit करें.
  • fitted vectorizer को transform करें.
  • एक DataFrame बनाएँ जहाँ आप sparse मैट्रिक्स को dense array में बदलें और कॉलम के नाम सही तरह से निर्दिष्ट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify max features 
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())
कोड संपादित करें और चलाएँ