Первые визуализации пропущенных данных
Бывает непросто разобраться, где именно в данных находятся пропущенные значения, — и здесь на помощь приходит визуализация.
Функция vis_miss() строит обзорную визуализацию пропусков в данных. Она также поддерживает кластеризацию строк по пропускам с помощью параметра cluster = TRUE, а также сортировку столбцов от наибольшего числа пропусков к наименьшему (sort_miss = TRUE).
Это упражнение является частью курса
Работа с пропущенными данными в R
Инструкции к упражнению
Используя набор данных riskfactors из пакета naniar:
- Примените
vis_miss(), чтобы визуализировать пропуски в данных. - Примените
vis_miss()с параметромcluster = TRUE, чтобы исследовать кластеры пропущенных значений. - Примените
vis_miss()с параметромsort_miss, чтобы упорядочить столбцы по количеству пропусков.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Visualize all of the missingness in the `riskfactors` dataset
vis_miss(___)
# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)