Jämför SMOTE med ursprungliga data
I föregående övning såg du att SMOTE plötsligt ger oss fler observationer av minoritetsklassen. Nu ska vi jämföra de resultaten med våra ursprungliga data för att få en tydlig bild av vad som faktiskt har hänt. Vi tittar på värderäkningarna för både gamla och nya data, och plottar de två punktdiagrammen sida vid sida. Du använder den fördefinierade funktionen compare_plot() för detta, som tar följande argument: X, y, X_resampled, y_resampled, method=''. Funktionen plottar dina ursprungliga data i ett punktdiagram tillsammans med de omsamplande data, sida vid sida.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Skriv ut värderäkningarna för de ursprungliga etiketterna,
y. Tänk på attyför närvarande är en NumPy-array, så för att använda värderäkningar tilldelar viysom ett pandas Series-objekt. - Upprepa steget och skriv ut värderäkningarna för
y_resampled. Det visar hur balansen mellan de två klasserna har förändrats med SMOTE. - Använd den fördefinierade funktionen
compare_plot()på både de ursprungliga data och de omsamplande data för att se punktdiagrammen sida vid sida.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')