Методы ресэмплинга
В предыдущем упражнении вы увидели, как дисбаланс классов может влиять на результаты матрицы ошибок. В этом упражнении вы попрактикуетесь в применении методов ресэмплинга, чтобы изучить, как различные подходы к ресэмплингу влияют на набор данных с дисбалансом классов — такой как loan_data. С помощью функции resample() из sklearn можно выровнять количество строк до уровня большинства — это называется оверсэмплинг (upsampling), а выравнивание до уровня меньшинства — андерсэмплинг (downsampling).
Вы создадите обе версии набора данных loan_data — с оверсэмплингом и с андерсэмплингом, — применёте к каждой из них логистическую регрессию и оцените качество модели. Обучающие данные и метки, соответствующие классу deny, ограничены только миноритарным классом, а данные с меткой approve — мажоритарным.
Объект разбивки на обучающую и тестовую выборки для получения предсказаний сохранён в рабочей среде как X_test — используйте его в упражнениях.
Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])
# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False, n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])