Aplicar SMOTE
En este ejercicio, vas a reequilibrar los datos usando la Synthetic Minority Over-sampling Technique (SMOTE). A diferencia de ROS, SMOTE no crea copias exactas de las observaciones, sino que genera nuevas muestras sintéticas que son bastante similares a las observaciones existentes de la clase minoritaria. Por tanto, SMOTE es un poco más sofisticado que simplemente copiar observaciones, así que vamos a aplicar SMOTE a nuestros datos de tarjeta de crédito.
El conjunto de datos df está disponible y los paquetes necesarios para SMOTE ya están importados. En el siguiente ejercicio, visualizarás el resultado y lo compararás con los datos originales para que veas con claridad el efecto de aplicar SMOTE.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Usa la función
prep_datasobredfpara crear las característicasXy las etiquetasy. - Define el método de remuestreo como SMOTE estándar, en la variable
method. - Usa
.fit_resample()sobre losXeyoriginales para obtener los nuevos datos remuestreados. - Representa los datos remuestreados con la función
plot_data().
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)