Порівняйте SMOTE з початковими даними
У попередній вправі ви побачили, що використання SMOTE раптово дає нам більше спостережень міноритарного класу. Порівняймо ці результати з нашими початковими даними, щоб краще зрозуміти, що саме відбулося. Знову перегляньмо підрахунок значень для старих і нових даних та побудуймо два діаграми розсіювання поруч. Ви використаєте попередньо визначену функцію compare_plot() для цього; вона приймає такі аргументи: X, y, X_resampled, y_resampled, method=''. Функція будує діаграму розсіювання для ваших початкових даних, а поруч — для повторно вибраних (resampled) даних.
Ця вправа є частиною курсу
Виявлення шахрайства в Python
Інструкції до вправи
- Виведіть підрахунок значень для наших початкових міток
y. Зверніть увагу, щоyзараз є масивом Numpy, тож щоб скористатися підрахунком значень, перетворітьyназад на об'єкт Series бібліотеки pandas. - Повторіть крок і виведіть підрахунок значень для
y_resampled. Це покаже, як змінилася балансованість між двома класами після SMOTE. - Скористайтеся заздалегідь визначеною функцією
compare_plot()для початкових і повторно вибраних даних, щоб побачити діаграми розсіювання поруч.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')