Производительность модели на сбалансированной выборке
Вы уже применили андерсэмплинг к обучающей выборке и обучили модель на полученных данных.
Качество предсказаний модели влияет не только на вероятность дефолта на тестовой выборке, но и на оценку новых кредитных заявок. Важно помнить: высокий показатель полноты (recall) для дефолтов особенно критичен, поскольку ошибочная классификация дефолта как не-дефолта обходится дороже.
Следующий важный шаг — сравнить производительность новой модели с исходной. Предсказания исходной модели хранятся в gbt_preds, а предсказания новой — в gbt2_preds.
Предсказания gbt_preds и gbt2_preds, а также y_test уже доступны в рабочем пространстве.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Check the classification reports
target_names = ['Non-Default', 'Default']
print(____(y_test, ____, target_names=target_names))
print(____(y_test, ____, target_names=target_names))