EmpezarEmpieza gratis

Compara SMOTE con los datos originales

En el ejercicio anterior, viste que usar SMOTE de repente nos da más observaciones de la clase minoritaria. Vamos a comparar esos resultados con nuestros datos originales para entender bien qué ha pasado. Vamos a volver a mirar los recuentos de valores de los datos antiguos y los nuevos, y a trazar los dos diagramas de dispersión uno al lado del otro. Para ello, usarás la función predefinida compare_plot(), que acepta los siguientes argumentos: X, y, X_resampled, y_resampled, method=''. La función representa tus datos originales en un diagrama de dispersión junto con los remuestreados, en paralelo.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Imprime los recuentos de valores de nuestras etiquetas originales, y. Ten en cuenta que y es actualmente un array de Numpy, así que para poder usar los recuentos de valores, volveremos a asignar y como un objeto Series de pandas.
  • Repite el paso e imprime los recuentos de valores de y_resampled. Esto te muestra cómo ha cambiado el equilibrio entre las dos clases con SMOTE.
  • Usa la función predefinida compare_plot() sobre nuestros datos originales y sobre los remuestreados para ver los diagramas de dispersión en paralelo.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))

# Print the value_counts
print(____(____(____)))

# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')
Editar y ejecutar código