Noch eine Runde Pruning auf Basis der AUC
Im Video hast du gesehen, wie das „volle“ Logit-Modell der logistischen Regression anhand der AUC zurückgeschnitten wurde. Du hast gesehen, dass die Variable home_ownership aus dem Modell gelöscht wurde, weil sich dadurch die AUC insgesamt verbessert hat. Nach zwei weiteren Runden wurden die Variablen age und ir_cat entfernt, was zum folgenden Modell führte:
log_3_remove_ir <- glm(loan_status ~ loan_amnt + grade + annual_inc + emp_cat, family = binomial, data = training_set)
mit einer AUC von 0,6545. Jetzt bist du dran: Prüfe, ob sich die AUC noch weiter verbessern lässt, indem du eine weitere Variable aus dem Modell entfernst.
Diese Übung ist Teil des Kurses
<Kurs>Kreditrisikomodellierung in R</Kurs>Übungsanweisungen
- Entferne jeweils eine Variable aus dem Modell
log_3_remove_ir. Denk daran, dass du die Standard-Linkfunktion (logit) verwenden sollst. - Erstelle für jedes der erzeugten Modelle Ausfallwahrscheinlichkeits-Vorhersagen.
- Verwende die Funktion
auc()mittest_set$loan_statusals erstem Argument und den Vorhersagen der vier Modelle als zweitem Argument, um die AUC für jedes Modell zu berechnen. - Kopiere den Namen des Objekts (wie in der ersten Frage dieser Übung angegeben), das das Modell mit der besten AUC repräsentiert.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Build four models each time deleting one variable in log_3_remove_ir
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat,
family = binomial, data = training_set)
log_4_remove_grade <-
log_4_remove_inc <-
log_4_remove_emp <-
# Make PD-predictions for each of the models
pred_4_remove_amnt <- predict(log_4_remove_amnt, newdata = test_set, type = "response")
pred_4_remove_grade <-
pred_4_remove_inc <-
pred_4_remove_emp <-
# Compute the AUCs