Régression logistique de base
Dans la vidéo, vous avez examiné un modèle de régression logistique incluant la variable age comme prédicteur. Vous allez maintenant ajouter une variable catégorielle et apprendre à interpréter ses estimations de paramètres.
Lorsque vous incluez une variable catégorielle dans un modèle de régression logistique sous R, vous obtenez une estimation de paramètre pour toutes ses modalités, sauf une. La modalité pour laquelle aucune estimation n’est fournie est appelée la « modalité de référence ». Le paramètre de chacune des autres modalités représente l’odds ratio en faveur d’un défaut de paiement entre la modalité considérée et la modalité de référence. Ne vous inquiétez pas si cela n’est pas encore complètement clair : vous ferez d’autres exercices sur ce point un peu plus loin !
Cet exercice fait partie du cours
<cours>Modélisation du risque de crédit en R</cours>Instructions de l’exercice
- Construisez un modèle de régression logistique appelé
log_model_catavec la variable catégorielleir_catcomme seul prédicteur. Votre appel à glm() doit contenir trois arguments : loan_status ~ ir_catfamily = "binomial"data = training_set- Affichez le résultat dans la console pour voir vos estimations de paramètres.
- Identifiez la modalité de référence en regardant à nouveau la structure de
ir_cat(dans l’ensemble de données completloan_data). Utilisez pour cela la fonctiontable().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build a glm model with variable ir_cat as a predictor
# Print the parameter estimates
# Look at the different categories in ir_cat using table()