Kolejna runda przycinania na podstawie AUC
W materiale wideo zobaczyłeś(-aś), jak „pełny" model regresji logistycznej z funkcją łączącą logit był przycinany na podstawie AUC. Zmienna home_ownership została usunięta z modelu, ponieważ poprawiło to ogólną wartość AUC. Po powtórzeniu tego procesu w dwóch kolejnych rundach usunięto zmienne age oraz ir_cat, co doprowadziło do modelu:
log_3_remove_ir <- glm(loan_status ~ loan_amnt + grade + annual_inc + emp_cat, family = binomial, data = training_set)
z AUC równym 0,6545. Teraz twoja kolej – sprawdź, czy AUC można jeszcze poprawić, usuwając kolejną zmienną z modelu.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w R
Instrukcje do ćwiczenia
- Usuwaj po jednej zmiennej z modelu
log_3_remove_ir. Pamiętaj, aby używać domyślnej funkcji łączącej (logit). - Wykonaj predykcję prawdopodobieństwa niewykonania zobowiązania dla każdego z utworzonych modeli.
- Użyj funkcji
auc(), podająctest_set$loan_statusjako pierwszy argument, a predykcje dla każdego z modeli jako drugi argument, aby uzyskać wartości AUC dla każdego modelu. - Skopiuj nazwę obiektu (podaną w pierwszym pytaniu tego ćwiczenia), który odpowiada modelowi z najlepszym AUC.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build four models each time deleting one variable in log_3_remove_ir
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat,
family = binomial, data = training_set)
log_4_remove_grade <-
log_4_remove_inc <-
log_4_remove_emp <-
# Make PD-predictions for each of the models
pred_4_remove_amnt <- predict(log_4_remove_amnt, newdata = test_set, type = "response")
pred_4_remove_grade <-
pred_4_remove_inc <-
pred_4_remove_emp <-
# Compute the AUCs