開始使用免費開始

彙總部分重複的資料

處理部分重複的另一種方式,是對那些在部分重複之間不同的值計算摘要統計量,例如平均數、中位數、最大值或最小值。當你不確定資料是如何蒐集、想先取得平均值,或者基於領域知識,你寧可高估也不要低估(反之亦然)時,這會很實用。

已載入 dplyr,且可使用 bike_share_rides

本練習屬於課程

R 的資料清理

檢視課程

練習說明

  • ride_iddatebike_share_rides 分組。
  • 新增名為 duration_min_avg 的欄位,內容為該列 ride_iddate 的騎乘時間平均值。
  • 依據 ride_iddate 去除重複,並保留資料框的所有欄位。
  • 移除 duration_min 欄位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
編輯並執行程式碼