Zacznij terazZacznij za darmo

Zastosowanie SMOTE

W tym ćwiczeniu ponownie zrównoważysz dane za pomocą techniki Synthetic Minority Over-sampling Technique (SMOTE). W odróżnieniu od prostego nadpróbkowania losowego (ROS), SMOTE nie tworzy dokładnych kopii obserwacji – zamiast tego generuje nowe, syntetyczne próbki, które są zbliżone do istniejących obserwacji z klasy mniejszościowej. SMOTE jest więc nieco bardziej zaawansowaną metodą niż zwykłe kopiowanie danych. Zastosujemy ją teraz do naszych danych z kart kredytowych. Zbiór danych df jest dostępny, a potrzebne pakiety zostały już zaimportowane. W kolejnym ćwiczeniu zwizualizujesz wynik i porównasz go z oryginalnymi danymi – dzięki temu wyraźnie zobaczysz efekt działania SMOTE.

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj funkcji prep_data na df, aby utworzyć cechy X i etykiety y.
  • Zdefiniuj metodę próbkowania jako standardowy SMOTE i przypisz ją do zmiennej method.
  • Wywołaj .fit_resample() na oryginalnych X i y, aby uzyskać nowo próbkowane dane.
  • Wyświetl próbkowane dane za pomocą funkcji plot_data().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from imblearn.over_sampling import SMOTE

# Run the prep_data function
X, y = ____(df)

# Define the resampling method
method = ____()

# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)

# Plot the resampled data
plot_data(____, ____)
Edytuj i uruchom kod