Zacznij terazZacznij za darmo

Porównanie SMOTE z oryginalnymi danymi

W poprzednim ćwiczeniu zobaczyłeś, że zastosowanie SMOTE zwiększa liczbę obserwacji należących do klasy mniejszościowej. Teraz porównajmy te wyniki z oryginalnymi danymi, żeby lepiej zrozumieć, co właściwie się stało. Przyjrzyj się ponownie liczebności klas w starym i nowym zbiorze danych, a następnie wyświetl dwa wykresy punktowe obok siebie. Skorzystasz z predefiniowanej funkcji compare_plot(), która przyjmuje następujące argumenty: X, y, X_resampled, y_resampled, method=''. Funkcja wyświetla oryginalny zbiór danych i zbiór po próbkowaniu jako wykresy punktowe obok siebie.

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyświetl liczebność klas dla oryginalnych etykiet y. Pamiętaj, że y jest teraz tablicą NumPy – żeby móc użyć zliczania wartości, przypisz y z powrotem jako obiekt Series z biblioteki pandas.
  • Powtórz ten krok i wyświetl liczebność klas dla y_resampled. Zobaczysz w ten sposób, jak SMOTE zmienił proporcje między obiema klasami.
  • Użyj predefiniowanej funkcji compare_plot() na oryginalnych danych oraz na danych po próbkowaniu, aby zobaczyć oba wykresy punktowe obok siebie.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))

# Print the value_counts
print(____(____(____)))

# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')
Edytuj i uruchom kod