शुरू करेंमुफ़्त में शुरू करें

आयामीयता और प्रीप्रोसेसिंग का विश्लेषण

इस अभ्यास में, आपको lem_corpus दिया गया है जिसमें पिछले अभ्यास के मूवी टैगलाइन के प्री-प्रोसेस्ड वर्ज़न शामिल हैं. यानी, टैगलाइन को लोअरकेस किया गया है, लेमाटाइज़ किया गया है, और स्टॉपवर्ड्स हटाए गए हैं.

आपका काम इन लेमाटाइज़्ड टैगलाइन के लिए बैग-ऑफ-वर्ड्स रिप्रेज़ेंटेशन bow_lem_matrix बनाना और इसकी शेप की तुलना पिछले अभ्यास में प्राप्त bow_matrix से करना है. जाँच के लिए lem_corpus में पहली पाँच लेमाटाइज़्ड टैगलाइन कंसोल पर प्रिंट कर दी गई हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में NLP के लिए Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn से CountVectorizer क्लास इम्पोर्ट करें.
  • CountVectorizer का एक ऑब्जेक्ट बनाइए. इसका नाम vectorizer रखें.
  • fit_transform() का उपयोग करके lem_corpus के लिए bow_lem_matrix जेनरेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
कोड संपादित करें और चलाएँ