选择唯一行
如果您有一个以因子形式存储的分类变量,通常需要知道其中包含哪些类别;可以使用 levels() 函数获取。对于 tibble,更常见的做法是查找具有唯一数据的行。沿用 SQL 的术语,这可以通过 distinct() 函数完成。您可以直接在数据集上使用它,从而找到某些列组合的唯一取值。例如,若要查找 x、y 和 z 列中取值的唯一组合,您可以这样写:
a_tibble %>%
distinct(x, y, z)
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
已为您创建名为 spark_conn 的 Spark 连接。附加到存储在 Spark 中的曲目信息的一个 tibble 已预定义为 track_metadata_tbl。
- 从
track_metadata_tbl中找出artist_name列的去重取值。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___