CommencezCommencez gratuitement

Appliquer SMOTE

Dans cet exercice, vous allez rééquilibrer nos données à l'aide de la Synthetic Minority Over-sampling Technique (SMOTE). Contrairement à ROS, SMOTE ne crée pas de copies exactes des observations ; il génère plutôt de nouveaux échantillons synthétiques qui ressemblent beaucoup aux observations existantes de la classe minoritaire. SMOTE est donc un peu plus sophistiqué que de simplement dupliquer des observations. Appliquons SMOTE à nos données de cartes de crédit. Le jeu de données df est disponible et les modules nécessaires à SMOTE sont importés. Dans l'exercice suivant, vous visualiserez le résultat et le comparerez aux données originales afin de bien voir l'effet de l'application de SMOTE.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Utilisez la fonction prep_data sur df pour créer les variables explicatives X et les étiquettes y.
  • Définissez la méthode de rééchantillonnage comme SMOTE (version régulière) dans la variable method.
  • Utilisez .fit_resample() sur les X et y originaux pour obtenir de nouvelles données rééchantillonnées.
  • Tracez les données rééchantillonnées à l'aide de la fonction plot_data().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from imblearn.over_sampling import SMOTE

# Run the prep_data function
X, y = ____(df)

# Define the resampling method
method = ____()

# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)

# Plot the resampled data
plot_data(____, ____)
Modifier et exécuter le code