Compara SMOTE con los datos originales
En el ejercicio anterior, viste que usar SMOTE de repente nos da más observaciones de la clase minoritaria. Vamos a comparar esos resultados con nuestros datos originales para entender bien qué ha pasado. Vamos a volver a mirar los recuentos de valores de los datos antiguos y los nuevos, y a trazar los dos diagramas de dispersión uno al lado del otro. Para ello, usarás la función predefinida compare_plot(), que acepta los siguientes argumentos: X, y, X_resampled, y_resampled, method=''. La función representa tus datos originales en un diagrama de dispersión junto con los remuestreados, en paralelo.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Imprime los recuentos de valores de nuestras etiquetas originales,
y. Ten en cuenta queyes actualmente un array de Numpy, así que para poder usar los recuentos de valores, volveremos a asignarycomo un objeto Series de pandas. - Repite el paso e imprime los recuentos de valores de
y_resampled. Esto te muestra cómo ha cambiado el equilibrio entre las dos clases con SMOTE. - Usa la función predefinida
compare_plot()sobre nuestros datos originales y sobre los remuestreados para ver los diagramas de dispersión en paralelo.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')