एक ही डेटा पर Tfidf और BOW
इस अभ्यास में, आप Amazon प्रोडक्ट reviews की review कॉलम को bag-of-words और tfidf, दोनों तरह की ट्रांसफॉर्मेशन से बदलेंगे.
दोनों vectorizers बनाइए, और सिर्फ अधिकतम फीचर्स की संख्या 100 सेट कीजिए. ट्रांसफॉर्मेशन के बाद DataFrames बनाईए और हर एक के टॉप 5 रो प्रिंट कीजिए.
ध्यान रखें कि vocabulary में अधिकतम फीचर्स कैसे सेट कर रहे हैं. बहुत बड़ा vocabulary साइज होने पर आपका सेशन डिसकनेक्ट हो सकता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Sentiment Analysis
अभ्यास निर्देश
- BOW और Tfidf vectorizers इम्पोर्ट करें.
reviewकॉलम से BOW और Tfidf vectorizer बनाकर fit करें, और बनने वाले फीचर्स की संख्या 100 तक सीमित करें.- ट्रांसफॉर्म की गई वेक्टर रिप्रेज़ेंटेशन्स से DataFrames बनाइए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())