CommencezCommencez gratuitement

Comparer SMOTE aux données originales

Dans le dernier exercice, vous avez vu qu'avec SMOTE, on obtient soudainement plus d'observations de la classe minoritaire. Comparons ces résultats à nos données originales pour bien comprendre ce qui s'est passé. Regardons de nouveau la fréquence des valeurs dans nos anciennes et nouvelles données, puis traçons les deux nuages de points côte à côte. Vous utiliserez la fonction prédéfinie compare_plot() pour cela, qui prend les arguments suivants : X, y, X_resampled, y_resampled, method=''. La fonction trace vos données originales dans un nuage de points, ainsi que les données rééchantillonnées, placées côte à côte.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Affichez la fréquence des valeurs de nos étiquettes originales, y. Notez que y est actuellement un tableau Numpy ; pour utiliser value_counts, réattribuez y en tant qu'objet Series de pandas.
  • Répétez l'étape et affichez la fréquence des valeurs pour y_resampled. Cela vous montre comment l'équilibre entre les deux classes a changé avec SMOTE.
  • Utilisez la fonction prédéfinie compare_plot() appliquée à nos données originales et à nos données rééchantillonnées pour voir les nuages de points côte à côte.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))

# Print the value_counts
print(____(____(____)))

# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')
Modifier et exécuter le code