汇总部分重复值
处理部分重复值的另一种方法是,对这些部分重复之间不同的取值计算汇总统计量,例如均值、中位数、最大值或最小值。当您不确定数据的采集方式、想要一个平均值时,这很有用;或者基于领域知识,您宁可得到偏高而不是偏低的估计(反之亦然)。
已加载 dplyr,并提供了 bike_share_rides。
本练习是课程的一部分
R 中的数据清洗
练习说明
- 按
ride_id和date对bike_share_rides进行分组。 - 新增名为
duration_min_avg的列,存放每行对应ride_id与date的骑行时长均值。 - 基于
ride_id和date去重,并保留数据框的所有列。 - 移除
duration_min列。
交互式实操练习
通过完成这段示例代码来试试这个练习。
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)