开始使用免费开始使用

汇总列

您在上一个练习中见到的 mutate() 函数以列为输入,并返回一列。如果要计算均值、最大值或标准差等汇总统计量,通常也是以列为输入,但希望返回单个值。这可以通过 summarize() 函数来实现。

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

请注意,dplyr 的一个理念(也传递给了 sparklyr)是始终将数据保持在 tibble 中。因此,这里的返回值是一个只有 1 行的 tibble,并且每个被计算的汇总统计量对应一列。

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

已经为您创建了名为 spark_conn 的 Spark 连接。连接到 Spark 中曲目信息的 tibble 已预定义为 track_metadata_tbl

  • 选择 titleduration 字段。
  • 将结果通过管道传递,创建一个新字段 duration_minutes,表示曲目时长(分钟)。
  • 再将结果通过管道传递给 summarize(),计算以分钟为单位的平均时长,并将该字段命名为 mean_duration_minutes

交互式实操练习

通过完成这段示例代码来试试这个练习。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
编辑并运行代码