Создание фильтра по доле пропущенных значений
Набор данных house_sales_df содержит целевую переменную price и набор предикторов, описывающих отдельные дома и определяющих их стоимость при продаже. В ряде признаков присутствует разное количество пропущенных значений. Если доля пропущенных значений слишком велика, признак окажется малоинформативным для предсказания цены дома и его можно исключить. В этом упражнении вы вычислите долю пропущенных значений для каждого столбца — это поможет вам выбрать подходящий порог фильтрации.
Пакет tidyverse уже загружен.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Сохраните общее количество строк в
house_sales_dfв переменнуюn. - Вычислите долю пропущенных значений для каждого столбца в
house_sales_dfи сохраните результат вmissing_vals_df.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate total rows
___ <- ___(___)
# Calculate missing value ratios
___ <- ___ %>%
___(___(___(), ~ ___(___(.)))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>%
mutate(missing_val_ratio = ___ / ___)
# Display missing value ratios
missing_vals_df