欠損のその他の要約
欠損の要約には、データの種類によって特に役立つものがあります。たとえば、miss_var_span() と miss_var_run() です。
miss_var_span()は、指定した変数について、一定のスパンごとに欠損値の数を計算します。これは時系列データで、週(7日)ごとの欠損パターンを探すのにとても有用です。miss_var_run()は、欠損が連続する「連なり(run)」や「連続区間(streak)」の数を計算します。たとえば「完全なデータが5つ続き、その後に欠損が5つ続く」といった、通常と異なる欠損パターンを見つけるのに役立ちます。
miss_var_span() と miss_var_run() はどちらも、dplyr の group_by 演算子と組み合わせて使えます。
この演習はコースの一部です
Rでの欠損データの扱い方
演習の手順
naniar の pedestrian データセットを使って、次を行ってください。
miss_var_span()を使い、スパンを 4000 として、データセット内の変数に対する欠損の要約を計算します。miss_var_run()を使い、データセット内のケースに対する欠損の要約を計算します。dplyrのgroup_by演算子を使い、monthでグループ化します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)
# Calculate the summaries for each span of missingness,
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)
# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()
# For each `month` variable, calculate the span of missingness
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)