始める無料で始める

欠損のその他の要約

欠損の要約には、データの種類によって特に役立つものがあります。たとえば、miss_var_span()miss_var_run() です。

  • miss_var_span() は、指定した変数について、一定のスパンごとに欠損値の数を計算します。これは時系列データで、週(7日)ごとの欠損パターンを探すのにとても有用です。

  • miss_var_run() は、欠損が連続する「連なり(run)」や「連続区間(streak)」の数を計算します。たとえば「完全なデータが5つ続き、その後に欠損が5つ続く」といった、通常と異なる欠損パターンを見つけるのに役立ちます。

miss_var_span()miss_var_run() はどちらも、dplyrgroup_by 演算子と組み合わせて使えます。

この演習はコースの一部です

Rでの欠損データの扱い方

コースを見る

演習の手順

naniarpedestrian データセットを使って、次を行ってください。

  • miss_var_span() を使い、スパンを 4000 として、データセット内の変数に対する欠損の要約を計算します。
  • miss_var_run() を使い、データセット内のケースに対する欠損の要約を計算します。
  • dplyrgroup_by 演算子を使い、month でグループ化します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)

# Calculate the summaries for each span of missingness, 
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)

# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()

# For each `month` variable, calculate the span of missingness 
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)
コードを編集して実行