Пошук прогнозованої пропущеності
Якщо дані пропущено повністю випадково, ви не зможете передбачити, коли змінна буде відсутня, спираючись на решту даних. Отже, якщо ви можете передбачити пропущеність, дані пропущено не повністю випадково. Тож скористаймося функцією glm() і підіберімо логістичну регресію, щоб перевірити пропущеність залежно від доступності житла у змінній mort, яку ви створили раніше. Якщо ви не знайдете структури в пропущених даних — тобто коефіцієнти при змінних нахилу не є статистично значущими, — це не означає, що ви довели, ніби дані пропущено випадково, але це видається правдоподібним.
Ця вправа є частиною курсу
Масштабована обробка даних в R
Інструкції до вправи
- Створіть змінну, що вказує, чи пропущено
"borrower_race"(дорівнює 9) у даних про іпотеку. - Створіть фактор-змінну зі стовпця
"affordability". - Зрегресуйте
affordability_factorнаborrower_race_indі викличте для неїsummary().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))