開始使用免費開始

完整重複

你收到通知,單車共享的資料管線已更新以提升效率,但因此更可能產生重複資料。為了繼續用相同的腳本每週分析騎乘統計,你需要先確保資料集中所有重複都被移除。

當資料框中有多列在所有欄位上的值都相同時,彼此就是「完整重複」。移除這類重複很重要,因為相同的值被重複多次,會影響像是平均數與中位數等摘要統計。每一筆騎乘記錄及其 ride_id 都應該是唯一的。

已載入 dplyr,且可使用 bike_share_rides

本練習屬於課程

R 的資料清理

檢視課程

練習說明

  • 取得 bike_share_rides 中完整重複列的總數。
  • bike_share_rides 移除所有完整重複,並將新資料框儲存為 bike_share_rides_unique
  • 取得新的 bike_share_rides_unique 資料框中完整重複列的總數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
編輯並執行程式碼