Porovnání reportů modelů
V kurzu jsi pracoval/a s logistickou regresí i se stromy s gradientním boostingem. Teď je čas oba modely porovnat a rozhodnout, který z nich použiješ pro finální predikce.
Jedním z nejjednodušších prvních kroků při porovnávání schopnosti různých modelů předpovídat pravděpodobnost defaultu je podívat se na jejich metriky z classification_report(). Ten ti umožní vidět celou řadu hodnotících metrik pro každý model vedle sebe. Protože data i modely jsou obvykle nevyvážené – s malým počtem defaultů – zaměř se teď na metriky právě pro defaulty.
Natrénované modely clf_logistic a clf_gbt jsou načteny v pracovním prostředí spolu s jejich predikcemi preds_df_lr a preds_df_gbt. Pro každý byl použit práh 0.4. K dispozici je také testovací sada y_test.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vypiš
classification_report()pro predikce logistické regrese. - Vypiš
classification_report()pro predikce stromu s gradientním boostingem. - Pomocí
precision_recall_fscore_support()vypišmacro averageF-1 skóre pro logistickou regresi. - Pomocí
precision_recall_fscore_support()vypišmacro averageF-1 skóre pro strom s gradientním boostingem.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the logistic regression classification report
target_names = ['Non-Default', 'Default']
print(____(____, ____['loan_status'], target_names=target_names))
# Print the gradient boosted tree classification report
print(____(____, ____['loan_status'], target_names=target_names))
# Print the default F-1 scores for the logistic regression
print(____(____,____['loan_status'], average = 'macro')[2])
# Print the default F-1 scores for the gradient boosted tree
print(____(____,____['loan_status'], average = 'macro')[2])