НачатьНачать бесплатно

Другие сводки пропущенных значений

Для разных типов данных полезны разные сводки пропущенных значений. Например, miss_var_span() и miss_var_run().

  • miss_var_span() вычисляет количество пропущенных значений в указанной переменной для повторяющегося интервала. Это особенно удобно при работе с временными рядами — например, для поиска еженедельных (7-дневных) закономерностей пропуска данных.

  • miss_var_run() вычисляет количество «серий» или «цепочек» пропущенных значений. Это помогает выявлять необычные закономерности — например, повторяющийся паттерн из 5 полных значений и 5 пропущенных.

Обе функции — miss_var_span() и miss_var_run() — работают с оператором group_by из пакета dplyr.

Это упражнение является частью курса

Работа с пропущенными данными в R

Посмотреть курс

Инструкции к упражнению

Используя набор данных pedestrian из пакета naniar:

  • Вычислите сводку пропущенных значений по переменным с помощью miss_var_span() для интервала 4000.
  • Вычислите сводку пропущенных значений по наблюдениям с помощью miss_var_run().
  • Объедините с оператором group_by из dplyr по переменной month.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)

# Calculate the summaries for each span of missingness, 
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)

# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()

# For each `month` variable, calculate the span of missingness 
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)
Редактировать и запускать код