tf-idf शब्द-फ्रिक्वेंसी ऐरे
इस अभ्यास में, आप दस्तावेज़ों के एक छोटे (toy) कलेक्शन के लिए tf-idf शब्द-फ्रिक्वेंसी ऐरे बनाएँगे. इसके लिए sklearn का TfidfVectorizer उपयोग करें. यह दस्तावेज़ों की सूची को शब्द-फ्रिक्वेंसी ऐरे में बदलता है और आउटपुट के रूप में csr_matrix देता है. इसके पास अन्य sklearn ऑब्जेक्ट्स की तरह fit() और transform() मेथड होते हैं.
आपको पालतू जानवरों पर आधारित toy दस्तावेज़ों की एक सूची documents दी गई है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Unsupervised Learning
अभ्यास निर्देश
sklearn.feature_extraction.textसेTfidfVectorizerइम्पोर्ट करें.tfidfनाम का एकTfidfVectorizerइंस्टेंस बनाएँ.tfidfके.fit_transform()मेथड कोdocumentsपर लागू करें और परिणामcsr_matमें असाइन करें. यह csr_matrix फॉर्मेट में शब्द-फ्रिक्वेंसी ऐरे है..toarray()मेथड कॉल करके और परिणाम प्रिंट करकेcsr_matदेखें. यह आपके लिए कर दिया गया है.- ऐरे के कॉलम अलग-अलग शब्दों से मेल खाते हैं. शब्दों की सूची पाने के लिए
tfidfके.get_feature_names_out()मेथड को कॉल करें और परिणामwordsमें असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)