遺漏狀況的其他摘要
有些遺漏狀況的摘要特別適用於不同型態的資料,例如 miss_var_span() 和 miss_var_run()。
miss_var_span()會在指定變數上,針對重複的區間計算遺漏值的數量。這在時間序列資料中特別有用,可以用來觀察每週(7 天)是否有遺漏的規律。miss_var_run()會計算遺漏的「連續段」或「連續次數」。這能幫你找出不尋常的遺漏模式,例如你可能會發現重複出現 5 筆完整、5 筆遺漏的型態。
miss_var_span() 和 miss_var_run() 都能與 dplyr 的 group_by 運算子一起使用。
本練習屬於課程
在 R 中處理遺漏值
練習說明
使用 naniar 套件中的 pedestrian 資料集:
- 使用
miss_var_span(),以 4000 的區間,計算資料集中各變數的遺漏狀況摘要。 - 使用
miss_var_run(),計算資料集中各個個案的遺漏狀況摘要。 - 結合 dplyr 的
group_by運算子,依month分組。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)
# Calculate the summaries for each span of missingness,
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)
# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()
# For each `month` variable, calculate the span of missingness
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)