修改列(mutate)
也许这会让您意外:并不是所有数据集一开始都是"干净"的!您常常需要修正取值,或基于现有数据新增列。在 dplyr 术语中,更改或新增列的过程称为"变换"(mutation),使用 mutate() 完成。该函数接受一个 tibble,以及用于更新列的具名参数。每个参数名对应要更改或新增的列名,参数值是说明如何更新的表达式。例如,给定包含 x 和 y 列的 tibble,下面的代码会更新 x 并创建新列 z。
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
如果您还没有注意到:基 R 函数无法处理 Spark tibble。因此在这里不能使用 within() 或 transform()。
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
我们已为您创建了名为 spark_conn 的 Spark 连接。已经在 Spark 中预置了与曲目元数据关联的 tibble,命名为 track_metadata_tbl。
- 选择
title和duration字段。请注意,duration的单位是秒。 - 将结果通过管道传递给
mutate(),创建一个新字段duration_minutes,其值为曲目的时长(单位:分钟)。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___