开始使用免费开始使用

完全重复

有人通知您,单车共享数据管道已做了优化以提升效率,但因此更可能产生重复数据。为了继续使用相同的脚本每周运行骑行统计分析,您需要先确保数据集中所有重复项都被移除。

当数据框的多行在所有列上的取值都相同,它们就是彼此的「完全重复」。移除此类重复很重要,因为相同取值被重复多次会改变诸如均值和中位数等汇总统计量。每次骑行及其 ride_id 都应当唯一。

已加载 dplyr,且 bike_share_rides 可用。

本练习是课程的一部分

R 中的数据清洗

查看课程

练习说明

  • 获取 bike_share_rides 中完全重复的总数。
  • bike_share_rides 中移除所有完全重复,并将新的数据框保存为 bike_share_rides_unique
  • 获取新的 bike_share_rides_unique 数据框中完全重复的总数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
编辑并运行代码