Réduire encore le modèle?
En supprimant la variable loan_amnt, l'AUC peut être encore améliorée à 0.6548! Le modèle obtenu est
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat, family = binomial, data = training_set)
Est-il possible de réduire le modèle de régression logistique à seulement deux variables sans diminuer l'AUC? Dans cet exercice, vous verrez si c'est possible!
Cette activité fait partie du cours
Modélisation du risque de crédit en R
Instructions de l’exercice
- Encore une fois, supprimez une variable à la fois dans le modèle
log_4_remove_amnt. Rappelez-vous que vous devez utiliser la fonction de liaison par défaut (logit). - Utilisez
predict()pour produire les probabilités de défaut pour chacun des modèles que vous avez créés. - Calculez les AUC pour chacun des trois modèles, en utilisant
test_set$loan_statuscomme premier argument et les prédictions de chacun des trois modèles comme deuxième argument. - Tracez la courbe ROC pour le modèle avec la plus grande AUC dans votre espace de travail, à l'aide de
plot(roc()), où le contenu deroc()est le même que pour la fonctionauc()ayant la plus grande AUC. Notez qu'il est possible que l'AUC ne puisse plus être améliorée par rapport au modèlelog_4_remove_amnt. Les prédictions pour ce modèle sont chargées dans votre espace de travail souspred_4_remove_amnt, au cas où ce modèle donnerait la plus grande AUC.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build three models each time deleting one variable in log_4_remove_amnt
log_5_remove_grade <- glm(loan_status ~ annual_inc + emp_cat, family = binomial, data = training_set)
log_5_remove_inc <-
log_5_remove_emp <-
# Make PD-predictions for each of the models
pred_5_remove_grade <- predict(log_5_remove_grade, newdata = test_set, type = "response")
pred_5_remove_inc <-
pred_5_remove_emp <-
# Compute the AUCs
# Plot the ROC-curve for the best model here