Začněte nyníZačněte zdarma

Hledáme předvídatelnost chybějících hodnot

Pokud data chybí zcela náhodně, nemělo by být možné předvídat, kdy nějaká hodnota chybí, na základě zbytku dat. Pokud to předvídat lze, data tedy nejsou chybějící zcela náhodně. Použijeme proto funkci glm() k nafitování logistické regrese a budeme hledat vzorec v chybějících hodnotách proměnné mort na základě dostupnosti. Pokud žádnou strukturu v chybějících datech nenajdeš – tedy proměnné sklonu nebudou signifikantní – neznamená to, že jsi dokázal/a, že data chybí náhodně, ale je to přinejmenším věrohodné.

Toto cvičení je součástí kurzu

Škálovatelné zpracování dat v R

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř proměnnou indikující, zda hodnota sloupce "borrower_race" chybí (rovná se 9) v hypotečních datech.
  • Vytvoř faktorovou proměnnou ze sloupce "affordability".
  • Regreduj affordability_factor na borrower_race_ind a zavolej na výsledek funkci summary().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9

# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])

# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))
Upravit a spustit kód