开始使用免费开始使用

Groups of mutants

除了按组计算汇总统计量之外,您还可以对列进行变换,使其取值按组而定。例如,一种常见的标准化方法是先减去均值,再除以标准差。您可以使用下面的代码对每个分组进行标准化:

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

已经为您创建了名为 spark_conn 的 Spark 连接。附着在 Spark 中曲目元数据上的 tibble 已预定义为 track_metadata_tbl

  • artist_nametrack_metadata 的内容进行分组。
  • 新增一列,命名为 time_since_first_release
    • 令其等于组内的 year 减去该艺人首次发行曲目的 year(即 min()year)。
  • time_since_first_release 的降序排列各行。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
编辑并运行代码