НачатьНачать бесплатно

Создание фильтра пропущенных значений

Фильтр нулевой дисперсии удаляет лишь часть малоинформативных признаков. Признаки могут содержать мало полезной информации и по другой причине — из-за большого количества пропущенных значений. В этом упражнении вы создадите фильтр пропущенных значений. Подход будет жёстким: удалению подлежит любой признак, содержащий хотя бы одно пропущенное значение, — даже если этот признак несёт значимую информацию.

Набор данных house_sales_df доступен в консоли, пакет tidyverse уже загружен.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Создайте фильтр пропущенных значений с помощью функций summarize(), across(), sum() и is.na(), чтобы удалить признаки с одним или более пропущенными значениями, и сохраните его в переменную na_filter.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a missing values filter
___ <- ___ %>% 
  ___(across(everything(), ~ ___)) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "NA_count") %>% 
  ___(___ > ___) %>% 
  pull(feature)
  
na_filter
Редактировать и запускать код