完整重複
你收到通知,單車共享的資料管線已更新以提升效率,但因此更可能產生重複資料。為了繼續用相同的腳本每週分析騎乘統計,你需要先確保資料集中所有重複都被移除。
當資料框中有多列在所有欄位上的值都相同時,彼此就是「完整重複」。移除這類重複很重要,因為相同的值被重複多次,會影響像是平均數與中位數等摘要統計。每一筆騎乘記錄及其 ride_id 都應該是唯一的。
已載入 dplyr,且可使用 bike_share_rides。
本練習屬於課程
R 的資料清理
練習說明
- 取得
bike_share_rides中完整重複列的總數。 - 從
bike_share_rides移除所有完整重複,並將新資料框儲存為bike_share_rides_unique。 - 取得新的
bike_share_rides_unique資料框中完整重複列的總數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___