Porównanie SMOTE z oryginalnymi danymi
W poprzednim ćwiczeniu zobaczyłeś, że zastosowanie SMOTE zwiększa liczbę obserwacji należących do klasy mniejszościowej. Teraz porównajmy te wyniki z oryginalnymi danymi, żeby lepiej zrozumieć, co właściwie się stało. Przyjrzyj się ponownie liczebności klas w starym i nowym zbiorze danych, a następnie wyświetl dwa wykresy punktowe obok siebie. Skorzystasz z predefiniowanej funkcji compare_plot(), która przyjmuje następujące argumenty: X, y, X_resampled, y_resampled, method=''. Funkcja wyświetla oryginalny zbiór danych i zbiór po próbkowaniu jako wykresy punktowe obok siebie.
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Wyświetl liczebność klas dla oryginalnych etykiet
y. Pamiętaj, żeyjest teraz tablicą NumPy – żeby móc użyć zliczania wartości, przypiszyz powrotem jako obiekt Series z biblioteki pandas. - Powtórz ten krok i wyświetl liczebność klas dla
y_resampled. Zobaczysz w ten sposób, jak SMOTE zmienił proporcje między obiema klasami. - Użyj predefiniowanej funkcji
compare_plot()na oryginalnych danych oraz na danych po próbkowaniu, aby zobaczyć oba wykresy punktowe obok siebie.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')