आयामीयता और प्रीप्रोसेसिंग का विश्लेषण
इस अभ्यास में, आपको lem_corpus दिया गया है जिसमें पिछले अभ्यास के मूवी टैगलाइन के प्री-प्रोसेस्ड वर्ज़न शामिल हैं. यानी, टैगलाइन को लोअरकेस किया गया है, लेमाटाइज़ किया गया है, और स्टॉपवर्ड्स हटाए गए हैं.
आपका काम इन लेमाटाइज़्ड टैगलाइन के लिए बैग-ऑफ-वर्ड्स रिप्रेज़ेंटेशन bow_lem_matrix बनाना और इसकी शेप की तुलना पिछले अभ्यास में प्राप्त bow_matrix से करना है. जाँच के लिए lem_corpus में पहली पाँच लेमाटाइज़्ड टैगलाइन कंसोल पर प्रिंट कर दी गई हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में NLP के लिए Feature Engineering
अभ्यास निर्देश
sklearnसेCountVectorizerक्लास इम्पोर्ट करें.CountVectorizerका एक ऑब्जेक्ट बनाइए. इसका नामvectorizerरखें.fit_transform()का उपयोग करकेlem_corpusके लिएbow_lem_matrixजेनरेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)