मूवी रिव्यूज़ की शब्द-सूची (vocabulary) का आकार
इस अभ्यास में, आप movies रिव्यूज़ डेटासेट के एक सैंपल का उपयोग करके शब्द-सूची (vocabulary) का आकार सीमित करने के अलग-अलग तरीकों का अभ्यास करेंगे। पहली कॉलम review है, जिसका टाइप object है, और दूसरी कॉलम label है, जहाँ नकारात्मक रिव्यू के लिए 0 और सकारात्मक रिव्यू के लिए 1 है.
जिन तीन तरीकों का आप उपयोग करेंगे, वे टेक्स्ट कॉलम को नए न्यूमेरिक कॉलम्स में बदल देंगे, जो हर रिव्यू में शब्द या वाक्यांश की गिनती को कैप्चर करेंगे। हर तरीका अंततः नए फीचर्स की अलग संख्या बनाने का परिणाम देगा।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Sentiment Analysis
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())