शुरू करेंमुफ़्त में शुरू करें

मूवी प्लॉट्स का TF-IDF

आइए रैंडम रूप से चुनी गई फिल्मों के प्लॉट्स पर डॉक्यूमेंट क्लस्टरिंग करें। डॉक्यूमेंट्स पर क्लस्टरिंग से पहले, उन्हें किसी भी अनचाहे नॉइज़ (जैसे स्पेशल कैरेक्टर्स और स्टॉप वर्ड्स) से साफ़ करना होता है और TF-IDF के जरिये उन्हें एक sparse मैट्रिक्स में बदलना होता है।

लिस्ट plots में स्टोर मूवी प्लॉट्स का TF-IDF निकालने के लिए TfidfVectorizer क्लास का उपयोग करें। TfidfVectorizer क्लास में tokenizer के रूप में उपयोग करने के लिए remove_noise() फंक्शन उपलब्ध है। .fit_transform() मेथड डेटा को TfidfVectorizer ऑब्जेक्ट्स में फिट करता है और फिर TF-IDF sparse मैट्रिक्स जेनरेट करता है।

नोट: .fit_transform() मेथड चलाने में कुछ सेकंड लगते हैं।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में क्लस्टर विश्लेषण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn से TfidfVectorizer क्लास इम्पोर्ट करें.
  • TfidfVectorizer क्लास को 0.1 और 0.75 की न्यूनतम और अधिकतम फ्रीक्वेंसी, तथा 50 अधिकतम फीचर्स के साथ इनिशियलाइज़ करें.
  • इनिशियलाइज़ किए गए TfidfVectorizer पर लिस्ट plots के साथ fit_transform() मेथड का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
कोड संपादित करें और चलाएँ