Escalar los datos
Para algoritmos de ML que usan métricas basadas en distancia, es crucial escalar siempre tus datos, ya que las variables en diferentes escalas distorsionarán los resultados. K-means utiliza la distancia euclídea para calcular la distancia a los centroides de los clústeres, por lo que primero necesitas escalar tus datos antes de implementar el algoritmo. Hagámoslo.
Tienes disponible el dataframe df del ejercicio anterior, con una preparación mínima para que puedas usarlo con sklearn. Las etiquetas de fraude se han guardado por separado en labels; podrás usarlas luego para comprobar los resultados. numpy se ha importado como np.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Importa
MinMaxScaler. - Transforma tu dataframe
dfen un array de numpyXtomando solo los valores dedfy asegúrate de que todos sean de tipofloat. - Aplica el escalador definido sobre
Xpara obtener los valores escaladosX_scaledy forzar todas tus variables a una escala de 0-1.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)