शुरू करेंमुफ़्त में शुरू करें

मूवी रिव्यू के लिए BoW वेक्टर

इस अभ्यास में, आपको दो pandas Series दिए गए हैं — X_train और X_test — जिनमें मूवी रिव्यू शामिल हैं. ये क्रमशः training और test रिव्यू डेटा को दर्शाते हैं. आपका काम है रिव्यू को प्रीप्रोसेस करना और CountVectorizer की मदद से इन दोनों सेट्स के लिए BoW वेक्टर जनरेट करना.

जब हम BoW वेक्टर मैट्रिसेज़ X_train_bow और X_test_bow बना लेंगे, तो हम इस पर कोई मशीन लर्निंग मॉडल लगाने और sentiment analysis करने की बहुत अच्छी स्थिति में होंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में NLP के लिए Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn लाइब्रेरी से CountVectorizer इम्पोर्ट करें.
  • vectorizer नाम का एक CountVectorizer ऑब्जेक्ट बनाएँ. सुनिश्चित करें कि सभी शब्द lowercase में कन्वर्ट हों और english stopwords हटा दिए जाएँ.
  • X_train का उपयोग करते हुए vectorizer को fit करें और फिर उसे इस्तेमाल करके X_train को transform करें ताकि BoW वेक्टर का सेट X_train_bow बन सके.
  • vectorizer का उपयोग करके X_test को transform करें ताकि BoW वेक्टर का सेट X_test_bow बन सके.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
कोड संपादित करें और चलाएँ