Импутация данных ниже диапазона с использованием nabular-данных
Важно отслеживать значения, которые мы импутировали. Без этого очень сложно оценить качество импутации.
Мы будем практиковать импутацию данных и воссоздавать визуализации из предыдущего набора упражнений, заменяя пропущенные значения на значения ниже диапазона данных.
Это очень удобный способ глубже исследовать пропуски, а также основа для импутации пропущенных значений.
Сначала мы импутируем данные ниже диапазона с помощью impute_below_all(), а затем визуализируем результат. Мы заметим, что хотя пропущенные значения в данном случае видны, нам всё равно нужен способ их отслеживать. В этом поможет шаблон программирования для отслеживания пропущенных данных.
Это упражнение является частью курса
Работа с пропущенными данными в R
Инструкции к упражнению
Используя данные oceanbuoys:
- Выполните импутацию ниже диапазона с помощью
impute_below_all(). - Визуализируйте новые пропущенные значения:
wind_ew— по оси x,air_temp_c— по оси y. - Выполните импутацию с отслеживанием данных, используя
bind_shadow(),impute_below_all()иadd_label_shadow(). - Отобразите график и изучите импутированные значения.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Impute the oceanbuoys data below the range using `impute_below`.
ocean_imp <- impute_below_all(___)
# Visualize the new missing values
ggplot(___,
aes(x = ___, y = ___)) +
geom_point()
# Impute and track data with `bind_shadow`, `impute_below_all`, and `add_label_shadow`
ocean_imp_track <- bind_shadow(___) %>%
___() %>%
___()
# Look at the imputed values
___