Začněte nyníZačněte zdarma

Porovnání SMOTE s původními daty

V předchozím cvičení jsi viděl/a, že použití SMOTE nám náhle přináší více pozorování menšinové třídy. Pojďme teď výsledky porovnat s původními daty, abychom lépe pochopili, co se vlastně stalo. Podíváme se znovu na počty hodnot ve starých i nových datech a vykreslíme oba bodové grafy vedle sebe. K tomu použiješ předdefinovanou funkci compare_plot(), která přijímá tyto argumenty: X, y, X_resampled, y_resampled, method=''. Funkce zobrazí původní data v bodovém grafu spolu s převzorkovanými daty vedle sebe.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vypiš počty hodnot původních štítků y. Měj na paměti, že y je aktuálně pole Numpy – aby šlo použít počítání hodnot, přiřaď y zpět jako objekt pandas Series.
  • Zopakuj krok a vypiš počty hodnot pro y_resampled. Uvidíš, jak se změnila rovnováha mezi oběma třídami po aplikaci SMOTE.
  • Použij předdefinovanou funkci compare_plot() na původní i převzorkovaná data, aby se bodové grafy zobrazily vedle sebe.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))

# Print the value_counts
print(____(____(____)))

# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')
Upravit a spustit kód