शुरू करेंमुफ़्त में शुरू करें

n-grams और vocabulary size के साथ BOW

इस अभ्यास में, आप Amazon प्रोडक्ट रिव्यूज़ के reviews डेटासेट का उपयोग करके एक बार फिर bag-of-words बनाना प्रैक्टिस करेंगे. आपका मुख्य काम vocabulary का आकार सीमित करना और टोकन सीक्वेंस की लंबाई तय करना होगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn से vectorizer इम्पोर्ट करें.
  • Vectorizer बनाइए और निम्न पैरामीटर ज़रूर सेट कीजिए: vocabulary का आकार 1000 तक सीमित हो, केवल bigrams शामिल हों, और वे terms न लें जो 500 से अधिक डॉक्यूमेंट में आते हैं.
  • Vectorizer को review कॉलम पर fit करें.
  • BOW representation से एक DataFrame बनाइए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
कोड संपादित करें और चलाएँ