НачатьНачать бесплатно

Создание фильтра по доле пропущенных значений

Набор данных house_sales_df содержит целевую переменную price и набор предикторов, описывающих отдельные дома и определяющих их стоимость при продаже. В ряде признаков присутствует разное количество пропущенных значений. Если доля пропущенных значений слишком велика, признак окажется малоинформативным для предсказания цены дома и его можно исключить. В этом упражнении вы вычислите долю пропущенных значений для каждого столбца — это поможет вам выбрать подходящий порог фильтрации.

Пакет tidyverse уже загружен.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Сохраните общее количество строк в house_sales_df в переменную n.
  • Вычислите долю пропущенных значений для каждого столбца в house_sales_df и сохраните результат в missing_vals_df.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate total rows
___ <-  ___(___)

# Calculate missing value ratios
___ <- ___ %>% 
  ___(___(___(), ~ ___(___(.)))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>% 
  mutate(missing_val_ratio = ___ / ___)

# Display missing value ratios
missing_vals_df
Редактировать и запускать код