K-means clustering: पहला अभ्यास
यह अभ्यास आपको किसी डेटासेट पर k-means clustering के उपयोग से परिचित कराएगा. आइए Comic Con डेटासेट का उपयोग करें और देखें कि इस पर k-means clustering कैसे काम करती है.
k-means clustering के दो चरण याद कीजिए:
kmeans()फंक्शन से cluster centers परिभाषित करें. इसके दो आवश्यक आर्ग्युमेंट होते हैं: observations और clusters की संख्या.vq()फंक्शन से cluster labels असाइन करें. इसके भी दो आवश्यक आर्ग्युमेंट होते हैं: observations और cluster centers.
डेटा एक pandas DataFrame comic_con में स्टोर है. x_scaled और y_scaled उन standardized X और Y coordinates के कॉलम नाम हैं जो किसी दिए गए समय पर लोगों की स्थिति दर्शाते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में क्लस्टर विश्लेषण
अभ्यास निर्देश
- SciPy में
kmeansऔरvqफंक्शन import कीजिए. kmeans()फंक्शन का उपयोग करके दो clusters के साथ cluster centers जनरेट कीजिए.- इन्हीं cluster centers का इस्तेमाल करके cluster labels बनाईए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()