Поиск закономерностей в пропущенных данных
Если данные пропущены полностью случайно, то предсказать факт пропуска переменной на основе остальных данных не получится. Следовательно, если такое предсказание возможно, данные пропущены не случайно. Используйте функцию glm(), чтобы построить логистическую регрессию и проверить, зависит ли пропуск в переменной mort от доступности жилья. Если структура в пропущенных данных не обнаружена — то есть переменные наклона незначимы — это не доказывает случайность пропусков, но делает такое предположение правдоподобным.
Это упражнение является частью курса
Масштабируемая обработка данных в R
Инструкции к упражнению
- Создайте переменную, которая указывает на пропуск значения в столбце
"borrower_race"(равного 9) в данных по ипотеке. - Создайте факторную переменную на основе столбца
"affordability". - Постройте регрессию
affordability_factorнаborrower_race_indи вызовите для неё функциюsummary().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))