CommencezCommencez gratuitement

Variables multiples dans un modèle de régression logistique

L'interprétation d'un seul paramètre demeure valide lorsqu'on inclut plusieurs variables dans un modèle. Lorsque vous incluez plusieurs variables et que vous demandez l'interprétation liée à la variation d'une variable donnée, on suppose que les autres variables restent constantes, donc inchangées. Il existe une expression latine pour cela, ceteris paribus, qui signifie littéralement « en gardant tout le reste pareil ».

Pour construire un modèle de régression logistique avec plusieurs variables, vous pouvez utiliser le signe + pour ajouter des variables. Votre formule ressemblera à ceci :

y ~ x1 + ... + xk

Pour évaluer le modèle, il y a plusieurs éléments à surveiller. Vous avez déjà examiné les valeurs des paramètres, mais ce n'est pas le seul aspect important. Il faut aussi tenir compte de la signification statistique d'une estimation de paramètre. La signification d'un paramètre est souvent appelée valeur p (p-value); toutefois, dans la sortie d'un modèle, vous la verrez indiquée comme Pr(>|t|). Dans glm, une faible signification est indiquée par un « . » et une très forte signification par « *** ». Lorsqu'un paramètre n'est pas significatif, cela signifie que vous ne pouvez pas affirmer qu'il est significativement différent de 0. La signification statistique est importante. En général, il n'est pertinent d'interpréter l'effet sur le défaut que pour les paramètres significatifs.

Cette activité fait partie du cours

Modélisation du risque de crédit en R

Voir le cours

Instructions de l’exercice

  • Créez un modèle de régression logistique avec la fonction glm() et le training_set. Incluez les variables age, ir_cat, grade, loan_amnt et annual_inc. Nommez ce modèle log_model_multi.
  • Obtenez les niveaux de signification à l'aide de summary() avec votre modèle. Vous approfondirez la signification de ces niveaux dans le prochain exercice !

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build the logistic regression model



# Obtain significance levels using summary()
Modifier et exécuter le code