完全重复
有人通知您,单车共享数据管道已做了优化以提升效率,但因此更可能产生重复数据。为了继续使用相同的脚本每周运行骑行统计分析,您需要先确保数据集中所有重复项都被移除。
当数据框的多行在所有列上的取值都相同,它们就是彼此的「完全重复」。移除此类重复很重要,因为相同取值被重复多次会改变诸如均值和中位数等汇总统计量。每次骑行及其 ride_id 都应当唯一。
已加载 dplyr,且 bike_share_rides 可用。
本练习是课程的一部分
R 中的数据清洗
练习说明
- 获取
bike_share_rides中完全重复的总数。 - 从
bike_share_rides中移除所有完全重复,并将新的数据框保存为bike_share_rides_unique。 - 获取新的
bike_share_rides_unique数据框中完全重复的总数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___