मूवी टैगलाइन के लिए BoW मॉडल
इस अभ्यास में, आपको 7000 से अधिक मूवी टैगलाइन का corpus दिया गया है. आपका काम इन टैगलाइनों के लिए bag of words निरूपण bow_matrix बनाना है. इस अभ्यास में हम text preprocessing स्टेप को नज़रअंदाज़ करेंगे और सीधे bow_matrix जनरेट करेंगे.
हम परिणामी bow_matrix के shape की भी जाँच करेंगे. निरीक्षण के लिए corpus की पहली पाँच टैगलाइन्स आपके लिए कंसोल पर प्रिंट की गई हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में NLP के लिए Feature Engineering
अभ्यास निर्देश
sklearnसेCountVectorizerक्लास इम्पोर्ट करें.- एक
CountVectorizerऑब्जेक्ट इंस्टैंशिएट करें. इसेvectorizerनाम दें. fit_transform()का उपयोग करकेcorpusके लिएbow_matrixजनरेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)