Régression logistique de base
Dans la vidéo, vous avez examiné un modèle de régression logistique qui incluait la variable age comme prédicteur. Vous allez maintenant ajouter une variable catégorielle et apprendre à interpréter ses estimations de paramètres.
Lorsque vous incluez une variable catégorielle dans un modèle de régression logistique en R, vous obtiendrez une estimation de paramètre pour toutes ses catégories sauf une. La catégorie pour laquelle aucune estimation n'est fournie est appelée la catégorie de référence. Le paramètre pour chacune des autres catégories représente le rapport de cotes en faveur d'un défaut de paiement entre la catégorie visée et la catégorie de référence. Ne vous en faites pas si ce n'est pas encore tout à fait clair : vous ferez d'autres exercices à ce sujet un peu plus loin !
Cette activité fait partie du cours
Modélisation du risque de crédit en R
Instructions de l’exercice
- Construisez un modèle de régression logistique nommé
log_model_catavec la variable catégorielleir_catcomme seul prédicteur. Votre appel à glm() doit contenir trois arguments : loan_status ~ ir_catfamily = "binomial"data = training_set- Affichez le résultat dans la console pour voir vos estimations de paramètres.
- Déterminez quelle est la catégorie de référence en examinant de nouveau la structure de
ir_cat(dans l'ensemble de données completloan_data). Utilisez pour cela la fonctiontable().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build a glm model with variable ir_cat as a predictor
# Print the parameter estimates
# Look at the different categories in ir_cat using table()