Сравнение отчётов моделей
Вы уже обучили модель логистической регрессии и деревья с градиентным бустингом. Пришло время сравнить их и выбрать ту, которая будет использоваться для итоговых предсказаний.
Одним из самых простых первых шагов при сравнении моделей по их способности предсказывать вероятность дефолта является анализ метрик из classification_report(). Это позволяет увидеть несколько оценочных показателей рядом для каждой модели. Поскольку данные и модели, как правило, несбалансированы — случаев дефолта мало, — сосредоточьтесь пока на метриках для класса дефолта.
Обученные модели clf_logistic и clf_gbt загружены в рабочую область вместе с их предсказаниями preds_df_lr и preds_df_gbt. Для каждой модели использован порог 0.4. Тестовая выборка y_test также доступна.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Инструкции к упражнению
- Выведите
classification_report()для предсказаний логистической регрессии. - Выведите
classification_report()для предсказаний деревьев с градиентным бустингом. - Выведите
macro averageF-1 меры для логистической регрессии с помощьюprecision_recall_fscore_support(). - Выведите
macro averageF-1 меры для деревьев с градиентным бустингом с помощьюprecision_recall_fscore_support().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the logistic regression classification report
target_names = ['Non-Default', 'Default']
print(____(____, ____['loan_status'], target_names=target_names))
# Print the gradient boosted tree classification report
print(____(____, ____['loan_status'], target_names=target_names))
# Print the default F-1 scores for the logistic regression
print(____(____,____['loan_status'], average = 'macro')[2])
# Print the default F-1 scores for the gradient boosted tree
print(____(____,____['loan_status'], average = 'macro')[2])