汇总列
您在上一个练习中见到的 mutate() 函数以列为输入,并返回一列。如果要计算均值、最大值或标准差等汇总统计量,通常也是以列为输入,但希望返回单个值。这可以通过 summarize() 函数来实现。
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
请注意,dplyr 的一个理念(也传递给了 sparklyr)是始终将数据保持在 tibble 中。因此,这里的返回值是一个只有 1 行的 tibble,并且每个被计算的汇总统计量对应一列。
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
已经为您创建了名为 spark_conn 的 Spark 连接。连接到 Spark 中曲目信息的 tibble 已预定义为 track_metadata_tbl。
- 选择
title和duration字段。 - 将结果通过管道传递,创建一个新字段
duration_minutes,表示曲目时长(分钟)。 - 再将结果通过管道传递给
summarize(),计算以分钟为单位的平均时长,并将该字段命名为mean_duration_minutes。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___