EmpezarEmpieza gratis

Método del codo

En el ejercicio anterior implementaste MiniBatch K-means con 8 clústeres, sin comprobar realmente cuál debería ser la cantidad adecuada. Para nuestro primer enfoque de detección de fraude, es importante acertar con el número de clústeres, especialmente si quieres usar los valores atípicos de esos clústeres como predicciones de fraude. Para decidir cuántos clústeres vas a usar, apliquemos el método del codo y veamos cuál debería ser el número óptimo de clústeres según este método.

X_scaled vuelve a estar disponible para que lo uses y MiniBatchKMeans se ha importado desde sklearn.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Define el rango entre 1 y 5 clústeres.
  • Ejecuta MiniBatch K-means en todos los clústeres del rango usando una list comprehension.
  • Ajusta cada modelo con los datos escalados y obtén las puntuaciones a partir de los datos escalados.
  • Representa los números de clúster y sus respectivas puntuaciones; tardará unos segundos en ejecutarse.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Define the range of clusters to try
clustno = range(____, ____)

# Run MiniBatch Kmeans over the number of clusters
kmeans = [____(n_clusters=i, random_state=0) for ____ in ____]

# Obtain the score for each model
score = [kmeans[i].fit(____).score(____) for i in range(len(kmeans))]

# Plot the models and their respective score 
plt.plot(____, ____)
plt.xlabel('Number of Clusters')
plt.ylabel('Score')
plt.title('Elbow Curve')
plt.show()
Editar y ejecutar código