EmpezarEmpieza gratis

Escalar los datos

Para algoritmos de ML que usan métricas basadas en distancia, es crucial escalar siempre tus datos, ya que las variables en diferentes escalas distorsionarán los resultados. K-means utiliza la distancia euclídea para calcular la distancia a los centroides de los clústeres, por lo que primero necesitas escalar tus datos antes de implementar el algoritmo. Hagámoslo.

Tienes disponible el dataframe df del ejercicio anterior, con una preparación mínima para que puedas usarlo con sklearn. Las etiquetas de fraude se han guardado por separado en labels; podrás usarlas luego para comprobar los resultados. numpy se ha importado como np.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Importa MinMaxScaler.
  • Transforma tu dataframe df en un array de numpy X tomando solo los valores de df y asegúrate de que todos sean de tipo float.
  • Aplica el escalador definido sobre X para obtener los valores escalados X_scaled y forzar todas tus variables a una escala de 0-1.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
Editar y ejecutar código