क्लस्टर्स की उपयुक्त संख्या निर्धारित करें
यहाँ, आप elbow criterion मेथड का उपयोग करके क्लस्टर्स की वह उपयुक्त संख्या पहचानेंगे जहाँ squared sum of error में कमी मामूली हो जाती है. यह शुरुआत में टेस्ट करने के लिए क्लस्टर्स की एक गणितीय ball-park संख्या पाने का महत्वपूर्ण चरण है. आप कई k क्लस्टर मूल्यों पर iterate करेंगे और प्रत्येक के लिए KMeans एल्गोरिदम चलाएँगे, फिर प्रत्येक k के विरुद्ध errors को प्लॉट करेंगे ताकि वह "elbow" पहचाना जा सके जहाँ errors में कमी धीमी पड़ने लगती है.
KMeans मॉड्यूल sklearn.cluster से लोड किया गया है, seaborn लाइब्रेरी sns के रूप में लोड है, और matplotlib.pyplot मॉड्यूल plt के रूप में लोड है. इसके अलावा, scaled डेटासेट wholesale_scaled_df के रूप में एक pandas DataFrame में लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मार्केटिंग के लिए मशीन लर्निंग
अभ्यास निर्देश
- एक खाली
ssedictionary बनाएँ. - 1 से 11 के बीच k मानों पर
KMeansएल्गोरिदम फिट करें और errors कोssedictionary में स्टोर करें. - प्लॉट में title जोड़ें.
- X-axis पर keys और Y-axis पर values के साथ एक scatter plot बनाएँ और चार्ट दिखाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create empty sse dictionary
sse = {}
# Fit KMeans algorithm on k values between 1 and 11
for k in ___(1, 11):
kmeans = ___(n_clusters=___, random_state=333)
kmeans.___(wholesale_scaled_df)
sse[k] = kmeans.inertia_
# Add the title to the plot
plt.___('Elbow criterion method chart')
# Create and display a scatter plot
sns.pointplot(x=list(sse.___()), y=list(sse.___()))
plt.___()