शुरू करेंमुफ़्त में शुरू करें

मूवी क्लस्टर्स में शीर्ष terms

अब जबकि आपने एक sparse मैट्रिक्स बना लिया है, क्लस्टर सेंटर्स जनरेट करें और हर क्लस्टर के शीर्ष तीन terms प्रिंट करें. kmeans() फंक्शन को प्रोसेस करने के लिए .todense() मेथड का उपयोग करके sparse मैट्रिक्स tfidf_matrix को सामान्य मैट्रिक्स में बदलें. उसके बाद, tfidf_vectorizer ऑब्जेक्ट से terms की सूची पाने के लिए .get_feature_names() मेथड का इस्तेमाल करें. Python में zip() फंक्शन दो सूचियों को साथ जोड़ता है.

पिछले अभ्यास से tfidf_vectorizer ऑब्जेक्ट और sparse मैट्रिक्स tfidf_matrix इस अभ्यास में उपलब्ध हैं. SciPy से kmeans इम्पोर्ट किया जा चुका है.

डेटा पॉइंट्स की संख्या अधिक होने पर बनने वाले क्लस्टर्स ज़्यादा स्पष्ट दिखेंगे. हालाँकि, इसके लिए अधिक कम्प्यूटेशनल पावर की ज़रूरत होती है, जो यहाँ एक अभ्यास में करना कठिन है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में क्लस्टर विश्लेषण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • kmeans() फंक्शन के माध्यम से क्लस्टर सेंटर्स जनरेट करें.
  • tfidf_vectorizer ऑब्जेक्ट से terms की सूची जनरेट करें.
  • प्रत्येक क्लस्टर के शीर्ष 3 terms प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

num_clusters = 2

# Generate cluster centers through the kmeans function
cluster_centers, distortion = ____

# Generate terms from the tfidf_vectorizer object
terms = tfidf_vectorizer.____()

for i in range(num_clusters):
    # Sort the terms and print top 3 terms
    center_terms = dict(zip(____, ____))
    sorted_terms = sorted(____, key=center_terms.get, reverse=True)
    print(____)
कोड संपादित करें और चलाएँ