НачатьНачать бесплатно

Импутация данных ниже диапазона с использованием nabular-данных

Важно отслеживать значения, которые мы импутировали. Без этого очень сложно оценить качество импутации.

Мы будем практиковать импутацию данных и воссоздавать визуализации из предыдущего набора упражнений, заменяя пропущенные значения на значения ниже диапазона данных.

Это очень удобный способ глубже исследовать пропуски, а также основа для импутации пропущенных значений.

Сначала мы импутируем данные ниже диапазона с помощью impute_below_all(), а затем визуализируем результат. Мы заметим, что хотя пропущенные значения в данном случае видны, нам всё равно нужен способ их отслеживать. В этом поможет шаблон программирования для отслеживания пропущенных данных.

Это упражнение является частью курса

Работа с пропущенными данными в R

Посмотреть курс

Инструкции к упражнению

Используя данные oceanbuoys:

  • Выполните импутацию ниже диапазона с помощью impute_below_all().
  • Визуализируйте новые пропущенные значения: wind_ew — по оси x, air_temp_c — по оси y.
  • Выполните импутацию с отслеживанием данных, используя bind_shadow(), impute_below_all() и add_label_shadow().
  • Отобразите график и изучите импутированные значения.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Impute the oceanbuoys data below the range using `impute_below`.
ocean_imp <- impute_below_all(___)

# Visualize the new missing values
ggplot(___, 
       aes(x = ___, y = ___)) +  
  geom_point()

# Impute and track data with `bind_shadow`, `impute_below_all`, and `add_label_shadow`
ocean_imp_track <- bind_shadow(___) %>% 
  ___() %>% 
  ___()

# Look at the imputed values
___
Редактировать и запускать код