Söker efter förutsägbar saknad data
Om data saknas helt slumpmässigt bör du inte kunna förutsäga när en variabel saknas utifrån resten av datan. Om du däremot kan förutsäga saknaden är datan inte slumpmässigt saknad. Låt oss därför använda funktionen glm() för att anpassa en logistisk regression och undersöka om saknaden i variabeln mort som du skapade tidigare har samband med affordability. Om du inte hittar någon struktur i den saknade datan – det vill säga att lutningstariablerna inte är signifikanta – betyder det inte att du har bevisat att datan saknas slumpmässigt, men det är ett rimligt antagande.
Den här övningen är en del av kursen
Skalbar databehandling i R
Övningsinstruktioner
- Skapa en variabel som anger om
"borrower_race"saknas (är lika med 9) i bolånedata. - Skapa en faktorvariabel av kolumnen
"affordability". - Regressera
affordability_factorpåborrower_race_indoch anropasummary()på resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))