Appliquer SMOTE
Dans cet exercice, vous allez rééquilibrer nos données à l'aide de la Synthetic Minority Over-sampling Technique (SMOTE). Contrairement à ROS, SMOTE ne crée pas de copies exactes des observations ; il génère plutôt de nouveaux échantillons synthétiques qui ressemblent beaucoup aux observations existantes de la classe minoritaire. SMOTE est donc un peu plus sophistiqué que de simplement dupliquer des observations. Appliquons SMOTE à nos données de cartes de crédit.
Le jeu de données df est disponible et les modules nécessaires à SMOTE sont importés. Dans l'exercice suivant, vous visualiserez le résultat et le comparerez aux données originales afin de bien voir l'effet de l'application de SMOTE.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Utilisez la fonction
prep_datasurdfpour créer les variables explicativesXet les étiquettesy. - Définissez la méthode de rééchantillonnage comme SMOTE (version régulière) dans la variable
method. - Utilisez
.fit_resample()sur lesXetyoriginaux pour obtenir de nouvelles données rééchantillonnées. - Tracez les données rééchantillonnées à l'aide de la fonction
plot_data().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)