शुरू करेंमुफ़्त में शुरू करें

मूवी टैगलाइन के लिए BoW मॉडल

इस अभ्यास में, आपको 7000 से अधिक मूवी टैगलाइन का corpus दिया गया है. आपका काम इन टैगलाइनों के लिए bag of words निरूपण bow_matrix बनाना है. इस अभ्यास में हम text preprocessing स्टेप को नज़रअंदाज़ करेंगे और सीधे bow_matrix जनरेट करेंगे.

हम परिणामी bow_matrix के shape की भी जाँच करेंगे. निरीक्षण के लिए corpus की पहली पाँच टैगलाइन्स आपके लिए कंसोल पर प्रिंट की गई हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में NLP के लिए Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn से CountVectorizer क्लास इम्पोर्ट करें.
  • एक CountVectorizer ऑब्जेक्ट इंस्टैंशिएट करें. इसे vectorizer नाम दें.
  • fit_transform() का उपयोग करके corpus के लिए bow_matrix जनरेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
कोड संपादित करें और चलाएँ