Zastosowanie SMOTE
W tym ćwiczeniu ponownie zrównoważysz dane za pomocą techniki Synthetic Minority Over-sampling Technique (SMOTE). W odróżnieniu od prostego nadpróbkowania losowego (ROS), SMOTE nie tworzy dokładnych kopii obserwacji – zamiast tego generuje nowe, syntetyczne próbki, które są zbliżone do istniejących obserwacji z klasy mniejszościowej. SMOTE jest więc nieco bardziej zaawansowaną metodą niż zwykłe kopiowanie danych. Zastosujemy ją teraz do naszych danych z kart kredytowych.
Zbiór danych df jest dostępny, a potrzebne pakiety zostały już zaimportowane. W kolejnym ćwiczeniu zwizualizujesz wynik i porównasz go z oryginalnymi danymi – dzięki temu wyraźnie zobaczysz efekt działania SMOTE.
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Użyj funkcji
prep_datanadf, aby utworzyć cechyXi etykietyy. - Zdefiniuj metodę próbkowania jako standardowy SMOTE i przypisz ją do zmiennej
method. - Wywołaj
.fit_resample()na oryginalnychXiy, aby uzyskać nowo próbkowane dane. - Wyświetl próbkowane dane za pomocą funkcji
plot_data().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)