开始使用免费开始使用

选择列

在 Spark 中操作数据框,最简单的方法是使用 dplyr 语法。使用 dplyr 语法操作数据框在 Data Manipulation with dplyrJoining Data with dplyr 课程中有详细介绍,而接下来的一个半章节也会覆盖所有重要要点。

dplyr 针对数据框有五类主要操作:选择列、过滤行、调整行顺序、修改或新增列,以及计算汇总统计量。

先从选择列开始。方法是调用 select(),传入一个 tibble,然后写出要保留的未加引号的列名。dplyr 函数通常与 magrittr 的管道运算符 %>% 搭配使用。若要选择 xyz 列,可以这样写:

a_tibble %>%
  select(x, y, z)

注意,sparklyr 目前不支持方括号索引。因此不能这样写:

a_tibble[, c("x", "y", "z")]

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

已经为您创建了名为 spark_conn 的 Spark 连接。存储在 Spark 中的曲目元数据已作为 tibble 预定义为 track_metadata_tbl

  • 使用 select() 选择 artist_namereleasetitleyear
  • 尝试用方括号索引实现同样的操作。提醒:这段代码会抛出错误,因此它被包在对 tryCatch() 的调用中。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
编辑并运行代码