Groups of mutants
除了按组计算汇总统计量之外,您还可以对列进行变换,使其取值按组而定。例如,一种常见的标准化方法是先减去均值,再除以标准差。您可以使用下面的代码对每个分组进行标准化:
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
已经为您创建了名为 spark_conn 的 Spark 连接。附着在 Spark 中曲目元数据上的 tibble 已预定义为 track_metadata_tbl。
- 按
artist_name对track_metadata的内容进行分组。 - 新增一列,命名为
time_since_first_release。- 令其等于组内的
year减去该艺人首次发行曲目的year(即min()的year)。
- 令其等于组内的
- 按
time_since_first_release的降序排列各行。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___