部分的な重複の集約
部分的な重複を扱う別の方法として、重複間で異なる値について、平均、中央値、最大値、最小値といった要約統計量を計算する方法があります。データの収集方法が不明で平均を取りたい場合や、ドメイン知識に基づいて過小評価よりも過大評価(またはその逆)を選びたい場合に便利です。
dplyr は読み込まれており、bike_share_rides が利用可能です。
この演習はコースの一部です
Rでのデータクリーニング
演習の手順
bike_share_ridesをride_idとdateでグループ化します。- 各行の
ride_idとdateに対する平均の走行時間を格納するduration_min_avg列を追加します。 ride_idとdateに基づいて重複を削除し、データフレームのすべての列を保持します。duration_min列を削除します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)