开始使用免费开始使用

汇总部分重复值

处理部分重复值的另一种方法是,对这些部分重复之间不同的取值计算汇总统计量,例如均值、中位数、最大值或最小值。当您不确定数据的采集方式、想要一个平均值时,这很有用;或者基于领域知识,您宁可得到偏高而不是偏低的估计(反之亦然)。

已加载 dplyr,并提供了 bike_share_rides

本练习是课程的一部分

R 中的数据清洗

查看课程

练习说明

  • ride_iddatebike_share_rides 进行分组。
  • 新增名为 duration_min_avg 的列,存放每行对应 ride_iddate 的骑行时长均值。
  • 基于 ride_iddate 去重,并保留数据框的所有列。
  • 移除 duration_min 列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
编辑并运行代码