НачатьНачать бесплатно

Методы ресэмплинга

В предыдущем упражнении вы увидели, как дисбаланс классов может влиять на результаты матрицы ошибок. В этом упражнении вы попрактикуетесь в применении методов ресэмплинга, чтобы изучить, как различные подходы к ресэмплингу влияют на набор данных с дисбалансом классов — такой как loan_data. С помощью функции resample() из sklearn можно выровнять количество строк до уровня большинства — это называется оверсэмплинг (upsampling), а выравнивание до уровня меньшинства — андерсэмплинг (downsampling).

Вы создадите обе версии набора данных loan_data — с оверсэмплингом и с андерсэмплингом, — применёте к каждой из них логистическую регрессию и оцените качество модели. Обучающие данные и метки, соответствующие классу deny, ограничены только миноритарным классом, а данные с меткой approve — мажоритарным.

Объект разбивки на обучающую и тестовую выборки для получения предсказаний сохранён в рабочей среде как X_test — используйте его в упражнениях.

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])

# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False,  n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])
Редактировать и запускать код