彙總部分重複的資料
處理部分重複的另一種方式,是對那些在部分重複之間不同的值計算摘要統計量,例如平均數、中位數、最大值或最小值。當你不確定資料是如何蒐集、想先取得平均值,或者基於領域知識,你寧可高估也不要低估(反之亦然)時,這會很實用。
已載入 dplyr,且可使用 bike_share_rides。
本練習屬於課程
R 的資料清理
練習說明
- 以
ride_id與date對bike_share_rides分組。 - 新增名為
duration_min_avg的欄位,內容為該列ride_id與date的騎乘時間平均值。 - 依據
ride_id與date去除重複,並保留資料框的所有欄位。 - 移除
duration_min欄位。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)