Создание фильтра пропущенных значений
Фильтр нулевой дисперсии удаляет лишь часть малоинформативных признаков. Признаки могут содержать мало полезной информации и по другой причине — из-за большого количества пропущенных значений. В этом упражнении вы создадите фильтр пропущенных значений. Подход будет жёстким: удалению подлежит любой признак, содержащий хотя бы одно пропущенное значение, — даже если этот признак несёт значимую информацию.
Набор данных house_sales_df доступен в консоли, пакет tidyverse уже загружен.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Создайте фильтр пропущенных значений с помощью функций
summarize(),across(),sum()иis.na(), чтобы удалить признаки с одним или более пропущенными значениями, и сохраните его в переменнуюna_filter.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a missing values filter
___ <- ___ %>%
___(across(everything(), ~ ___)) %>%
pivot_longer(everything(), names_to = "feature", values_to = "NA_count") %>%
___(___ > ___) %>%
pull(feature)
na_filter