Сравнение SMOTE с исходными данными
В предыдущем упражнении вы убедились, что применение SMOTE позволяет получить больше наблюдений для миноритарного класса. Давайте сравним эти результаты с исходными данными, чтобы лучше понять, что произошло. Проверим количество значений в старых и новых данных, а затем отобразим два точечных графика рядом. Для этого воспользуйтесь заранее определённой функцией compare_plot(), которая принимает следующие аргументы: X, y, X_resampled, y_resampled, method=''. Функция строит точечный график исходных данных и график после ресемплирования — рядом друг с другом.
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Выведите количество значений исходных меток
y. Обратите внимание, чтоyсейчас является массивом NumPy, поэтому для подсчёта значений сначала преобразуйте его в объект pandas Series. - Повторите этот шаг и выведите количество значений для
y_resampled. Это покажет, как изменился баланс между двумя классами после применения SMOTE. - Вызовите заранее определённую функцию
compare_plot()для исходных и ресемплированных данных, чтобы сравнить точечные графики рядом друг с другом.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the value_counts on the original labels y
print(pd.value_counts(pd.Series(____)))
# Print the value_counts
print(____(____(____)))
# Run compare_plot
compare_plot(____, ____, ____, ____, method='SMOTE')