Méthode du coude
Dans l'exercice précédent, vous avez implanté MiniBatch K-means avec 8 grappes, sans vérifier quel devrait être le bon nombre de grappes. Pour notre première approche de détection de fraude, il est important de bien déterminer le nombre de grappes, surtout si vous souhaitez utiliser les valeurs aberrantes de ces grappes comme prédictions de fraude. Pour choisir le nombre de grappes à utiliser, appliquons la méthode du coude et voyons quel nombre optimal de grappes elle suggère.
X_scaled est de nouveau à votre disposition et MiniBatchKMeans a été importé de sklearn.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Définissez l'intervalle entre 1 et 5 grappes.
- Exécutez MiniBatch K-means sur toutes les grappes de l'intervalle à l'aide d'une compréhension de liste.
- Ajustez chaque modèle sur les données normalisées et obtenez les scores à partir de ces mêmes données.
- Tracez les numéros de grappes et leurs scores respectifs; l'exécution prendra quelques secondes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define the range of clusters to try
clustno = range(____, ____)
# Run MiniBatch Kmeans over the number of clusters
kmeans = [____(n_clusters=i, random_state=0) for ____ in ____]
# Obtain the score for each model
score = [kmeans[i].fit(____).score(____) for i in range(len(kmeans))]
# Plot the models and their respective score
plt.plot(____, ____)
plt.xlabel('Number of Clusters')
plt.ylabel('Score')
plt.title('Elbow Curve')
plt.show()