Repérer une absence de données prévisible
Si des données sont manquantes complètement au hasard, vous ne devriez pas pouvoir prévoir quand une variable est manquante à partir du reste des données. Donc, si vous pouvez prédire l'absence, alors les données ne sont pas manquantes complètement au hasard. Utilisons donc la fonction glm() pour ajuster une régression logistique et chercher une structure d'absence en fonction de l'abordabilité dans la variable mort que vous avez créée plus tôt. Si vous ne trouvez aucune structure dans les données manquantes — c.-à-d. que les variables de pente ne sont pas significatives — cela ne prouve pas que les données sont manquantes au hasard, mais c'est plausible.
Cette activité fait partie du cours
Traitement de données évolutif en R
Instructions de l’exercice
- Créez une variable indiquant si
"borrower_race"est manquante (égale à 9) dans les données hypothécaires. - Créez une variable facteur à partir de la colonne
"affordability". - Réalisez une régression de
affordability_factorsurborrower_race_indet appliquezsummary()sur le modèle.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))