Создание данных теневой матрицы
Пропущенные данные бывает непросто обнаружить: они не заявляют о себе явно, а прячутся среди остальных значений.
Один из способов выявить пропуски — изменить подход к восприятию данных: рассматривать каждое значение с точки зрения того, пропущено оно или нет.
Функция as_shadow() в R преобразует датафрейм в теневую матрицу — специальный формат данных, в котором каждое значение обозначается как пропущенное (NA) или непропущенное (!NA).
Названия столбцов теневой матрицы совпадают с исходными, но к ним добавляется суффикс _NA.
Чтобы сопоставлять исходные значения с их статусом пропуска, используйте функцию bind_shadow(). Формат данных, в котором столбцы теневой матрицы присоединены к исходным данным, называется nabular-данными.
Это упражнение является частью курса
Работа с пропущенными данными в R
Инструкции к упражнению
Используя набор данных oceanbuoys:
- Создайте данные теневой матрицы с помощью
as_shadow(). - Создайте набор данных в формате nabular, присоединив теневую матрицу к исходным данным с помощью
bind_shadow(). - Присоедините только переменные с пропущенными значениями, используя
bind_shadow(only_miss = TRUE).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create shadow matrix data with `as_shadow()`
___(___)
# Create nabular data by binding the shadow to the data with `bind_shadow()`
___(___)
# Bind only the variables with missing values by using bind_shadow(only_miss = TRUE)
___(___, ___ = TRUE)