Hledáme předvídatelnost chybějících hodnot
Pokud data chybí zcela náhodně, nemělo by být možné předvídat, kdy nějaká hodnota chybí, na základě zbytku dat. Pokud to předvídat lze, data tedy nejsou chybějící zcela náhodně. Použijeme proto funkci glm() k nafitování logistické regrese a budeme hledat vzorec v chybějících hodnotách proměnné mort na základě dostupnosti. Pokud žádnou strukturu v chybějících datech nenajdeš – tedy proměnné sklonu nebudou signifikantní – neznamená to, že jsi dokázal/a, že data chybí náhodně, ale je to přinejmenším věrohodné.
Toto cvičení je součástí kurzu
Škálovatelné zpracování dat v R
Pokyny k cvičení
- Vytvoř proměnnou indikující, zda hodnota sloupce
"borrower_race"chybí (rovná se 9) v hypotečních datech. - Vytvoř faktorovou proměnnou ze sloupce
"affordability". - Regreduj
affordability_factornaborrower_race_inda zavolej na výsledek funkcisummary().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))