EmpezarEmpieza gratis

Aplicar SMOTE

En este ejercicio, vas a reequilibrar los datos usando la Synthetic Minority Over-sampling Technique (SMOTE). A diferencia de ROS, SMOTE no crea copias exactas de las observaciones, sino que genera nuevas muestras sintéticas que son bastante similares a las observaciones existentes de la clase minoritaria. Por tanto, SMOTE es un poco más sofisticado que simplemente copiar observaciones, así que vamos a aplicar SMOTE a nuestros datos de tarjeta de crédito. El conjunto de datos df está disponible y los paquetes necesarios para SMOTE ya están importados. En el siguiente ejercicio, visualizarás el resultado y lo compararás con los datos originales para que veas con claridad el efecto de aplicar SMOTE.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Usa la función prep_data sobre df para crear las características X y las etiquetas y.
  • Define el método de remuestreo como SMOTE estándar, en la variable method.
  • Usa .fit_resample() sobre los X e y originales para obtener los nuevos datos remuestreados.
  • Representa los datos remuestreados con la función plot_data().

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

from imblearn.over_sampling import SMOTE

# Run the prep_data function
X, y = ____(df)

# Define the resampling method
method = ____()

# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)

# Plot the resampled data
plot_data(____, ____)
Editar y ejecutar código