ПочатиПочніть безкоштовно

Застосування SMOTE

У цій вправі ви збалансуєте дані за допомогою Synthetic Minority Over-sampling Technique (SMOTE). На відміну від ROS, SMOTE не створює точних копій спостережень, а генерує нові синтетичні зразки, які дуже подібні до наявних спостережень у міноритарному класі. Отже, SMOTE дещо витонченіший за просте копіювання спостережень, тож застосуймо його до наших даних із кредитних карток. Набір даних df доступний, а пакети, потрібні для SMOTE, імпортовано. У наступній вправі ви візуалізуєте результат і порівняєте його з початковими даними, щоб чітко побачити ефект від застосування SMOTE.

Ця вправа є частиною курсу

Виявлення шахрайства в Python

Переглянути курс

Інструкції до вправи

  • Використайте функцію prep_data для df, щоб створити ознаки X і мітки y.
  • Визначте метод повторного вибіркового відбору як звичайний SMOTE у змінній method.
  • Застосуйте .fit_resample() до початкових X та y, щоб отримати нові повторно вибрані дані.
  • Побудуйте графік повторно вибраних даних за допомогою функції plot_data().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from imblearn.over_sampling import SMOTE

# Run the prep_data function
X, y = ____(df)

# Define the resampling method
method = ____()

# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)

# Plot the resampled data
plot_data(____, ____)
Редагувати та запускати код