开始使用免费开始使用

修改列(mutate)

也许这会让您意外:并不是所有数据集一开始都是"干净"的!您常常需要修正取值,或基于现有数据新增列。在 dplyr 术语中,更改或新增列的过程称为"变换"(mutation),使用 mutate() 完成。该函数接受一个 tibble,以及用于更新列的具名参数。每个参数名对应要更改或新增的列名,参数值是说明如何更新的表达式。例如,给定包含 xy 列的 tibble,下面的代码会更新 x 并创建新列 z

a_tibble %>%
  mutate(
    x = x + y,
    z = log(x)  
  )

如果您还没有注意到:基 R 函数无法处理 Spark tibble。因此在这里不能使用 within()transform()

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

我们已为您创建了名为 spark_conn 的 Spark 连接。已经在 Spark 中预置了与曲目元数据关联的 tibble,命名为 track_metadata_tbl

  • 选择 titleduration 字段。请注意,duration 的单位是秒。
  • 将结果通过管道传递给 mutate(),创建一个新字段 duration_minutes,其值为曲目的时长(单位:分钟)。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___
编辑并运行代码