始める無料で始める

部分的な重複の集約

部分的な重複を扱う別の方法として、重複間で異なる値について、平均、中央値、最大値、最小値といった要約統計量を計算する方法があります。データの収集方法が不明で平均を取りたい場合や、ドメイン知識に基づいて過小評価よりも過大評価(またはその逆)を選びたい場合に便利です。

dplyr は読み込まれており、bike_share_rides が利用可能です。

この演習はコースの一部です

Rでのデータクリーニング

コースを見る

演習の手順

  • bike_share_ridesride_iddate でグループ化します。
  • 各行の ride_iddate に対する平均の走行時間を格納する duration_min_avg 列を追加します。
  • ride_iddate に基づいて重複を削除し、データフレームのすべての列を保持します。
  • duration_min 列を削除します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
コードを編集して実行