मूवी रिव्यू के लिए BoW वेक्टर
इस अभ्यास में, आपको दो pandas Series दिए गए हैं — X_train और X_test — जिनमें मूवी रिव्यू शामिल हैं. ये क्रमशः training और test रिव्यू डेटा को दर्शाते हैं. आपका काम है रिव्यू को प्रीप्रोसेस करना और CountVectorizer की मदद से इन दोनों सेट्स के लिए BoW वेक्टर जनरेट करना.
जब हम BoW वेक्टर मैट्रिसेज़ X_train_bow और X_test_bow बना लेंगे, तो हम इस पर कोई मशीन लर्निंग मॉडल लगाने और sentiment analysis करने की बहुत अच्छी स्थिति में होंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में NLP के लिए Feature Engineering
अभ्यास निर्देश
sklearnलाइब्रेरी सेCountVectorizerइम्पोर्ट करें.vectorizerनाम का एकCountVectorizerऑब्जेक्ट बनाएँ. सुनिश्चित करें कि सभी शब्द lowercase में कन्वर्ट हों औरenglishstopwords हटा दिए जाएँ.X_trainका उपयोग करते हुएvectorizerको fit करें और फिर उसे इस्तेमाल करकेX_trainको transform करें ताकि BoW वेक्टर का सेटX_train_bowबन सके.vectorizerका उपयोग करकेX_testको transform करें ताकि BoW वेक्टर का सेटX_test_bowबन सके.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)