मूवी क्लस्टर्स में शीर्ष terms
अब जबकि आपने एक sparse मैट्रिक्स बना लिया है, क्लस्टर सेंटर्स जनरेट करें और हर क्लस्टर के शीर्ष तीन terms प्रिंट करें. kmeans() फंक्शन को प्रोसेस करने के लिए .todense() मेथड का उपयोग करके sparse मैट्रिक्स tfidf_matrix को सामान्य मैट्रिक्स में बदलें. उसके बाद, tfidf_vectorizer ऑब्जेक्ट से terms की सूची पाने के लिए .get_feature_names() मेथड का इस्तेमाल करें. Python में zip() फंक्शन दो सूचियों को साथ जोड़ता है.
पिछले अभ्यास से tfidf_vectorizer ऑब्जेक्ट और sparse मैट्रिक्स tfidf_matrix इस अभ्यास में उपलब्ध हैं. SciPy से kmeans इम्पोर्ट किया जा चुका है.
डेटा पॉइंट्स की संख्या अधिक होने पर बनने वाले क्लस्टर्स ज़्यादा स्पष्ट दिखेंगे. हालाँकि, इसके लिए अधिक कम्प्यूटेशनल पावर की ज़रूरत होती है, जो यहाँ एक अभ्यास में करना कठिन है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्लस्टर विश्लेषण
अभ्यास निर्देश
kmeans()फंक्शन के माध्यम से क्लस्टर सेंटर्स जनरेट करें.tfidf_vectorizerऑब्जेक्ट से terms की सूची जनरेट करें.- प्रत्येक क्लस्टर के शीर्ष 3 terms प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
num_clusters = 2
# Generate cluster centers through the kmeans function
cluster_centers, distortion = ____
# Generate terms from the tfidf_vectorizer object
terms = tfidf_vectorizer.____()
for i in range(num_clusters):
# Sort the terms and print top 3 terms
center_terms = dict(zip(____, ____))
sorted_terms = sorted(____, key=center_terms.get, reverse=True)
print(____)