选择列
在 Spark 中操作数据框,最简单的方法是使用 dplyr 语法。使用 dplyr 语法操作数据框在 Data Manipulation with dplyr 和 Joining Data with dplyr 课程中有详细介绍,而接下来的一个半章节也会覆盖所有重要要点。
dplyr 针对数据框有五类主要操作:选择列、过滤行、调整行顺序、修改或新增列,以及计算汇总统计量。
先从选择列开始。方法是调用 select(),传入一个 tibble,然后写出要保留的未加引号的列名。dplyr 函数通常与 magrittr 的管道运算符 %>% 搭配使用。若要选择 x、y 和 z 列,可以这样写:
a_tibble %>%
select(x, y, z)
注意,sparklyr 目前不支持方括号索引。因此不能这样写:
a_tibble[, c("x", "y", "z")]
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
已经为您创建了名为 spark_conn 的 Spark 连接。存储在 Spark 中的曲目元数据已作为 tibble 预定义为 track_metadata_tbl。
- 使用
select()选择artist_name、release、title和year。 - 尝试用方括号索引实现同样的操作。提醒:这段代码会抛出错误,因此它被包在对
tryCatch()的调用中。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)