शुरू करेंमुफ़्त में शुरू करें

BOW के साथ टोकन अनुक्रम लंबाई निर्दिष्ट करें

वीडियो में आपने देखा कि टोकनों की अलग-अलग लंबाई — जिसे हमने n-grams कहा — निर्दिष्ट करने से संदर्भ को बेहतर पकड़ा जा सकता है, जो कई बार बहुत महत्वपूर्ण होता है.

इस अभ्यास में, आप Amazon प्रोडक्ट रिव्यूज़ के एक सैंपल पर काम करेंगे. आपका काम review कॉलम का उपयोग करके BOW vocabulary बनाना है और टोकनों के अनुक्रम की लंबाई निर्धारित करनी है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • वेक्टराइज़र बनाइए और टोकन अनुक्रम लंबाई को यूनिग्राम और बिग्राम पर सेट कीजिए.
  • वेक्टराइज़र को fit कीजिए.
  • fit किए गए वेक्टराइज़र से transform कीजिए.
  • DataFrame में, कॉलम नाम सही तरह से निर्दिष्ट करना सुनिश्चित कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
कोड संपादित करें और चलाएँ