शुरू करेंमुफ़्त में शुरू करें

शब्दों की गिनती (I)

जब उच्च-स्तरीय जानकारी दर्ज हो जाए, तो आप हर टेक्स्ट की असली सामग्री के आधार पर फीचर बनाना शुरू कर सकते हैं। ऐसा करने का एक तरीका वही है जैसा आपने पहले के लेसन्स में categorical variables के साथ किया था.

  • डेटासेट में हर यूनिक शब्द के लिए एक कॉलम बनाया जाता है.
  • हर एंट्री के लिए, वह शब्द जितनी बार आता है उसकी गिनती की जाती है और वही count उस कॉलम में डाली जाती है.

इन "count" कॉलम्स का उपयोग फिर मशीन लर्निंग मॉडल्स को ट्रेन करने में किया जा सकता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn.feature_extraction.text से CountVectorizer इम्पोर्ट करें.
  • CountVectorizer को instantiate करके cv में असाइन करें.
  • वेक्टराइज़र को text_clean कॉलम पर fit करें.
  • वेक्टराइज़र द्वारा जनरेट किए गए फीचर नेम्स प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
कोड संपादित करें और चलाएँ