CommencezCommencez gratuitement

Repérer une absence de données prévisible

Si des données sont manquantes complètement au hasard, vous ne devriez pas pouvoir prévoir quand une variable est manquante à partir du reste des données. Donc, si vous pouvez prédire l'absence, alors les données ne sont pas manquantes complètement au hasard. Utilisons donc la fonction glm() pour ajuster une régression logistique et chercher une structure d'absence en fonction de l'abordabilité dans la variable mort que vous avez créée plus tôt. Si vous ne trouvez aucune structure dans les données manquantes — c.-à-d. que les variables de pente ne sont pas significatives — cela ne prouve pas que les données sont manquantes au hasard, mais c'est plausible.

Cette activité fait partie du cours

Traitement de données évolutif en R

Voir le cours

Instructions de l’exercice

  • Créez une variable indiquant si "borrower_race" est manquante (égale à 9) dans les données hypothécaires.
  • Créez une variable facteur à partir de la colonne "affordability".
  • Réalisez une régression de affordability_factor sur borrower_race_ind et appliquez summary() sur le modèle.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9

# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])

# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))
Modifier et exécuter le code