Застосування SMOTE
У цій вправі ви збалансуєте дані за допомогою Synthetic Minority Over-sampling Technique (SMOTE). На відміну від ROS, SMOTE не створює точних копій спостережень, а генерує нові синтетичні зразки, які дуже подібні до наявних спостережень у міноритарному класі. Отже, SMOTE дещо витонченіший за просте копіювання спостережень, тож застосуймо його до наших даних із кредитних карток.
Набір даних df доступний, а пакети, потрібні для SMOTE, імпортовано. У наступній вправі ви візуалізуєте результат і порівняєте його з початковими даними, щоб чітко побачити ефект від застосування SMOTE.
Ця вправа є частиною курсу
Виявлення шахрайства в Python
Інструкції до вправи
- Використайте функцію
prep_dataдляdf, щоб створити ознакиXі міткиy. - Визначте метод повторного вибіркового відбору як звичайний SMOTE у змінній
method. - Застосуйте
.fit_resample()до початковихXтаy, щоб отримати нові повторно вибрані дані. - Побудуйте графік повторно вибраних даних за допомогою функції
plot_data().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)