शुरू करेंमुफ़्त में शुरू करें

बुक टाइटल्स के लिए Bag-of-words

PyBooks के पास अब बुक टाइटल्स की एक सूची है जिसे आगे के विश्लेषण के लिए एन्कोड करना है. डेटा टीम मानती है कि Bag of Words (BoW) मॉडल सबसे अच्छा तरीका हो सकता है.

निम्न पैकेज आपके लिए इम्पोर्ट कर दिए गए हैं: torch, torchtext.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Bag-of-words लागू करने के लिए CountVectorizer क्लास इम्पोर्ट करें.
  • जिस क्लास को आपने इम्पोर्ट किया है उसका एक ऑब्जेक्ट इनिशियलाइज़ करें, फिर इस ऑब्जेक्ट का उपयोग करके titles को मैट्रिक्स रिप्रेजेंटेशन में ट्रांसफॉर्म करें.
  • get_feature_names_out() मेथड से पहले पाँच फीचर नाम और एन्कोड किए गए टाइटल्स निकालें और दिखाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
कोड संपादित करें और चलाएँ