Nouvelle ronde d'élagage basée sur l'AUC
Dans la vidéo, vous avez vu comment le modèle de régression logistique « complet » avec une fonction de liaison logit a été élagué en se basant sur l'AUC. Vous avez vu que la variable home_ownership a été supprimée du modèle, ce qui a amélioré l'AUC globale. Après avoir répété ce processus deux autres fois, les variables age et ir_cat ont été supprimées, ce qui donne le modèle :
log_3_remove_ir <- glm(loan_status ~ loan_amnt + grade + annual_inc + emp_cat, family = binomial, data = training_set)
avec une AUC de 0,6545. À vous maintenant de vérifier si l'AUC peut encore être améliorée en retirant une autre variable du modèle.
Cette activité fait partie du cours
Modélisation du risque de crédit en R
Instructions de l’exercice
- Supprimez une variable à la fois du modèle
log_3_remove_ir. Rappelez-vous que vous devez utiliser la fonction de liaison par défaut (logit). - Générez, pour chacun des modèles créés, des prédictions de probabilité de défaut.
- Utilisez la fonction
auc()avectest_set$loan_statuscomme premier argument et les prédictions de chacun des quatre modèles comme deuxième argument afin d'obtenir l'AUC de chaque modèle. - Copiez le nom de l'objet (tel qu'indiqué dans la première question de cet exercice) correspondant au modèle ayant la meilleure AUC.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build four models each time deleting one variable in log_3_remove_ir
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat,
family = binomial, data = training_set)
log_4_remove_grade <-
log_4_remove_inc <-
log_4_remove_emp <-
# Make PD-predictions for each of the models
pred_4_remove_amnt <- predict(log_4_remove_amnt, newdata = test_set, type = "response")
pred_4_remove_grade <-
pred_4_remove_inc <-
pred_4_remove_emp <-
# Compute the AUCs