Lze model dále zjednodušit?
Odebráním proměnné loan_amnt lze AUC dále zlepšit na 0,6548! Výsledný model vypadá takto:
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat, family = binomial, data = training_set)
Je možné zredukovat logistický regresní model na pouhé dvě proměnné, aniž by se AUC snížilo? V tomto cvičení to zjistíš!
Toto cvičení je součástí kurzu
Modelování kreditního rizika v R
Pokyny k cvičení
- Opět odebírej vždy jednu proměnnou z modelu
log_4_remove_amnt. Nezapomeň použít výchozí linkovou funkci (logit). - Pomocí
predict()vypočítej pravděpodobnost selhání pro každý vytvořený model. - Zjisti hodnoty AUC pro každý ze tří modelů – jako první argument použij
test_set$loan_statusa jako druhý predikce příslušného modelu. - Vykresli ROC křivku pro model s nejvyšším AUC pomocí
plot(roc()), kde obsahroc()je stejný jako obsah funkceauc()s nejvyšším AUC. Může se stát, že AUC již nelze oproti modelulog_4_remove_amntdále zlepšit. Pro tento případ jsou predikce tohoto modelu načteny v pracovním prostředí jakopred_4_remove_amnt.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build three models each time deleting one variable in log_4_remove_amnt
log_5_remove_grade <- glm(loan_status ~ annual_inc + emp_cat, family = binomial, data = training_set)
log_5_remove_inc <-
log_5_remove_emp <-
# Make PD-predictions for each of the models
pred_5_remove_grade <- predict(log_5_remove_grade, newdata = test_set, type = "response")
pred_5_remove_inc <-
pred_5_remove_emp <-
# Compute the AUCs
# Plot the ROC-curve for the best model here