Comparer SMOTE aux données originales
Dans le dernier exercice, vous avez vu qu'avec SMOTE, on obtient soudainement plus d'observations de la classe minoritaire. Comparons ces résultats à nos données originales pour bien comprendre ce qui s'est passé. Regardons de nouveau la fréquence des valeurs dans nos anciennes et nouvelles données, puis traçons les deux nuages de points côte à côte. Vous utiliserez la fonction prédéfinie compare_plot() pour cela, qui prend les arguments suivants : X, y, X_resampled, y_resampled, method=''. La fonction trace vos données originales dans un nuage de points, ainsi que les données rééchantillonnées, placées côte à côte.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Affichez la fréquence des valeurs de nos étiquettes originales,
y. Notez queyest actuellement un tableau Numpy ; pour utiliser value_counts, réattribuezyen tant qu'objet Series de pandas. - Répétez l'étape et affichez la fréquence des valeurs pour
y_resampled. Cela vous montre comment l'équilibre entre les deux classes a changé avec SMOTE. - Utilisez la fonction prédéfinie
compare_plot()appliquée à nos données originales et à nos données rééchantillonnées pour voir les nuages de points côte à côte.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')