मूवी प्लॉट्स का TF-IDF
आइए रैंडम रूप से चुनी गई फिल्मों के प्लॉट्स पर डॉक्यूमेंट क्लस्टरिंग करें। डॉक्यूमेंट्स पर क्लस्टरिंग से पहले, उन्हें किसी भी अनचाहे नॉइज़ (जैसे स्पेशल कैरेक्टर्स और स्टॉप वर्ड्स) से साफ़ करना होता है और TF-IDF के जरिये उन्हें एक sparse मैट्रिक्स में बदलना होता है।
लिस्ट plots में स्टोर मूवी प्लॉट्स का TF-IDF निकालने के लिए TfidfVectorizer क्लास का उपयोग करें। TfidfVectorizer क्लास में tokenizer के रूप में उपयोग करने के लिए remove_noise() फंक्शन उपलब्ध है। .fit_transform() मेथड डेटा को TfidfVectorizer ऑब्जेक्ट्स में फिट करता है और फिर TF-IDF sparse मैट्रिक्स जेनरेट करता है।
नोट: .fit_transform() मेथड चलाने में कुछ सेकंड लगते हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्लस्टर विश्लेषण
अभ्यास निर्देश
sklearnसेTfidfVectorizerक्लास इम्पोर्ट करें.TfidfVectorizerक्लास को 0.1 और 0.75 की न्यूनतम और अधिकतम फ्रीक्वेंसी, तथा 50 अधिकतम फीचर्स के साथ इनिशियलाइज़ करें.- इनिशियलाइज़ किए गए
TfidfVectorizerपर लिस्ट plots के साथfit_transform()मेथड का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____