Elbow method
पिछले अभ्यास में आपने 8 क्लस्टर्स के साथ MiniBatch K-means इम्प्लीमेंट किया था, बिना यह जाँचे कि क्लस्टर्स की सही संख्या क्या होनी चाहिए. हमारी पहली fraud detection अप्रोच के लिए, क्लस्टर्स की संख्या सही चुनना ज़रूरी है, खासकर जब आप उन क्लस्टर्स के outliers को fraud प्रेडिक्शंस के रूप में इस्तेमाल करना चाहते हैं. यह तय करने के लिए कि आप कितने क्लस्टर्स लेने वाले हैं, आइए Elbow method लगाते हैं और देखते हैं कि इस विधि के आधार पर optimal क्लस्टर्स की संख्या क्या आती है.
X_scaled आपके लिए फिर से उपलब्ध है और MiniBatchKMeans को sklearn से इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Fraud Detection
अभ्यास निर्देश
- रेंज को 1 से 5 क्लस्टर्स के बीच परिभाषित करें.
- लिस्ट कॉम्प्रिहेंशन का उपयोग करके रेंज में दिए गए सभी क्लस्टर्स पर MiniBatch K-means चलाएँ.
- प्रत्येक मॉडल को स्केल किए गए डेटा पर फिट करें और उसी स्केल्ड डेटा से स्कोर प्राप्त करें.
- क्लस्टर नंबर और उनके संबंधित स्कोर प्लॉट करें; चलने में कुछ सेकंड लगेंगे.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Define the range of clusters to try
clustno = range(____, ____)
# Run MiniBatch Kmeans over the number of clusters
kmeans = [____(n_clusters=i, random_state=0) for ____ in ____]
# Obtain the score for each model
score = [kmeans[i].fit(____).score(____) for i in range(len(kmeans))]
# Plot the models and their respective score
plt.plot(____, ____)
plt.xlabel('Number of Clusters')
plt.ylabel('Score')
plt.title('Elbow Curve')
plt.show()