Další kolo prořezávání na základě AUC
Ve videu jsi viděl/a, jak byl „plný" model logistické regrese s logit linkem prořezáván na základě AUC. Z modelu byla odstraněna proměnná home_ownership, protože to celkové AUC zlepšilo. Po dalších dvou kolech tohoto procesu byly odstraněny proměnné age a ir_cat, čímž vznikl model:
log_3_remove_ir <- glm(loan_status ~ loan_amnt + grade + annual_inc + emp_cat, family = binomial, data = training_set)
s hodnotou AUC 0,6545. Teď je řada na tobě – zkus zjistit, zda lze AUC ještě zlepšit odebráním další proměnné z modelu.
Toto cvičení je součástí kurzu
Modelování kreditního rizika v R
Pokyny k cvičení
- V modelu
log_3_remove_irodebírej vždy jednu proměnnou – nezapomeň použít výchozí link funkci (logit). - Pro každý z vytvořených modelů spočítej pravděpodobnost selhání splácení.
- Pomocí funkce
auc()zadej jako první argumenttest_set$loan_statusa jako druhý argument predikce pro každý model, abys získal/a hodnoty AUC pro jednotlivé modely. - Zkopíruj název objektu (uvedeného v první otázce tohoto cvičení), který odpovídá modelu s nejlepším AUC.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build four models each time deleting one variable in log_3_remove_ir
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat,
family = binomial, data = training_set)
log_4_remove_grade <-
log_4_remove_inc <-
log_4_remove_emp <-
# Make PD-predictions for each of the models
pred_4_remove_amnt <- predict(log_4_remove_amnt, newdata = test_set, type = "response")
pred_4_remove_grade <-
pred_4_remove_inc <-
pred_4_remove_emp <-
# Compute the AUCs