НачатьНачать бесплатно

Первые визуализации пропущенных данных

Бывает непросто разобраться, где именно в данных находятся пропущенные значения, — и здесь на помощь приходит визуализация.

Функция vis_miss() строит обзорную визуализацию пропусков в данных. Она также поддерживает кластеризацию строк по пропускам с помощью параметра cluster = TRUE, а также сортировку столбцов от наибольшего числа пропусков к наименьшему (sort_miss = TRUE).

Это упражнение является частью курса

Работа с пропущенными данными в R

Посмотреть курс

Инструкции к упражнению

Используя набор данных riskfactors из пакета naniar:

  • Примените vis_miss(), чтобы визуализировать пропуски в данных.
  • Примените vis_miss() с параметром cluster = TRUE, чтобы исследовать кластеры пропущенных значений.
  • Примените vis_miss() с параметром sort_miss, чтобы упорядочить столбцы по количеству пропусков.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Visualize all of the missingness in the `riskfactors`  dataset
vis_miss(___)

# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)

# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
Редактировать и запускать код