ПочатиПочніть безкоштовно

Порівняйте SMOTE з початковими даними

У попередній вправі ви побачили, що використання SMOTE раптово дає нам більше спостережень міноритарного класу. Порівняймо ці результати з нашими початковими даними, щоб краще зрозуміти, що саме відбулося. Знову перегляньмо підрахунок значень для старих і нових даних та побудуймо два діаграми розсіювання поруч. Ви використаєте попередньо визначену функцію compare_plot() для цього; вона приймає такі аргументи: X, y, X_resampled, y_resampled, method=''. Функція будує діаграму розсіювання для ваших початкових даних, а поруч — для повторно вибраних (resampled) даних.

Ця вправа є частиною курсу

Виявлення шахрайства в Python

Переглянути курс

Інструкції до вправи

  • Виведіть підрахунок значень для наших початкових міток y. Зверніть увагу, що y зараз є масивом Numpy, тож щоб скористатися підрахунком значень, перетворіть y назад на об'єкт Series бібліотеки pandas.
  • Повторіть крок і виведіть підрахунок значень для y_resampled. Це покаже, як змінилася балансованість між двома класами після SMOTE.
  • Скористайтеся заздалегідь визначеною функцією compare_plot() для початкових і повторно вибраних даних, щоб побачити діаграми розсіювання поруч.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))

# Print the value_counts
print(____(____(____)))

# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')
Редагувати та запускати код