शुरू करेंमुफ़्त में शुरू करें

स्टेप 2: एक वेक्टराइज़र बनाना

इस अभ्यास में, आपसे reviews डेटासेट की review कॉलम पर TfIDf ट्रांसफॉर्मेशन बनाने के लिए कहा गया है. आपको n-grams, stop words, tokens का पैटर्न, और vocabulary के साइज से जुड़े आर्ग्यूमेंट्स निर्दिष्ट करने हैं.

यह क्लासिफायर ट्रेन करने से पहले का आख़िरी स्टेप है, जिससे हम किसी रिव्यू का sentiment प्रेडिक्ट करेंगे.

ध्यान रखें कि maximum number of features ठीक से सेट करें, क्योंकि बहुत बड़ा vocabulary size आपके सेशन को डिस्कनेक्ट कर सकता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Tfidf वेक्टराइज़र और इंग्लिश स्टॉप वर्ड्स की डिफ़ॉल्ट लिस्ट इम्पोर्ट करें.
  • Tfidf वेक्टराइज़र बनाइए और — इसी क्रम में — ये आर्ग्यूमेंट्स सेट कीजिए: stop words के रूप में इंग्लिश स्टॉप वर्ड्स की डिफ़ॉल्ट लिस्ट; n-grams के रूप में यूनि- और बाइ-ग्राम; maximum number of features 200; दिए गए पैटर्न का इस्तेमाल करते हुए सिर्फ शब्दों को कैप्चर करें.
  • Tfidf वेक्टराइज़र का उपयोग करके एक DataFrame बनाइए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
कोड संपादित करें और चलाएँ