Porovnání SMOTE s původními daty
V předchozím cvičení jsi viděl/a, že použití SMOTE nám náhle přináší více pozorování menšinové třídy. Pojďme teď výsledky porovnat s původními daty, abychom lépe pochopili, co se vlastně stalo. Podíváme se znovu na počty hodnot ve starých i nových datech a vykreslíme oba bodové grafy vedle sebe. K tomu použiješ předdefinovanou funkci compare_plot(), která přijímá tyto argumenty: X, y, X_resampled, y_resampled, method=''. Funkce zobrazí původní data v bodovém grafu spolu s převzorkovanými daty vedle sebe.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Vypiš počty hodnot původních štítků
y. Měj na paměti, žeyje aktuálně pole Numpy – aby šlo použít počítání hodnot, přiřaďyzpět jako objekt pandas Series. - Zopakuj krok a vypiš počty hodnot pro
y_resampled. Uvidíš, jak se změnila rovnováha mezi oběma třídami po aplikaci SMOTE. - Použij předdefinovanou funkci
compare_plot()na původní i převzorkovaná data, aby se bodové grafy zobrazily vedle sebe.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')