缺失情况的其他汇总方式
针对不同类型的数据,有些缺失情况的汇总尤其有用。例如,miss_var_span() 和 miss_var_run()。
miss_var_span()会在指定变量上,按重复的区间计算缺失值的数量。这在时间序列数据中非常有用,例如用于查看每周(7 天)是否存在缺失的规律。miss_var_run()会计算缺失的连续"区段"或"连串"(runs/streaks)的数量。这有助于发现异常的缺失模式。例如,您可能会发现 5 个完整观测后紧跟 5 个缺失的重复模式。
miss_var_span() 和 miss_var_run() 都可以与 dplyr 的 group_by 运算符配合使用。
本练习是课程的一部分
在 R 中处理缺失数据
练习说明
使用 naniar 中的 pedestrian 数据集:
- 使用
miss_var_span(),以 4000 为区间,计算数据集中各变量的缺失情况汇总。 - 使用
miss_var_run(),计算数据集中各观测(case)的缺失情况汇总。 - 结合 dplyr 的
group_by运算符按month分组。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)
# Calculate the summaries for each span of missingness,
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)
# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()
# For each `month` variable, calculate the span of missingness
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)