Другие сводки пропущенных значений
Для разных типов данных полезны разные сводки пропущенных значений. Например, miss_var_span() и miss_var_run().
miss_var_span()вычисляет количество пропущенных значений в указанной переменной для повторяющегося интервала. Это особенно удобно при работе с временными рядами — например, для поиска еженедельных (7-дневных) закономерностей пропуска данных.miss_var_run()вычисляет количество «серий» или «цепочек» пропущенных значений. Это помогает выявлять необычные закономерности — например, повторяющийся паттерн из 5 полных значений и 5 пропущенных.
Обе функции — miss_var_span() и miss_var_run() — работают с оператором group_by из пакета dplyr.
Это упражнение является частью курса
Работа с пропущенными данными в R
Инструкции к упражнению
Используя набор данных pedestrian из пакета naniar:
- Вычислите сводку пропущенных значений по переменным с помощью
miss_var_span()для интервала 4000. - Вычислите сводку пропущенных значений по наблюдениям с помощью
miss_var_run(). - Объедините с оператором
group_byизdplyrпо переменнойmonth.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)
# Calculate the summaries for each span of missingness,
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)
# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()
# For each `month` variable, calculate the span of missingness
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)