开始使用免费开始使用

选择唯一行

如果您有一个以因子形式存储的分类变量,通常需要知道其中包含哪些类别;可以使用 levels() 函数获取。对于 tibble,更常见的做法是查找具有唯一数据的行。沿用 SQL 的术语,这可以通过 distinct() 函数完成。您可以直接在数据集上使用它,从而找到某些列组合的唯一取值。例如,若要查找 xyz 列中取值的唯一组合,您可以这样写:

a_tibble %>%
  distinct(x, y, z)

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

已为您创建名为 spark_conn 的 Spark 连接。附加到存储在 Spark 中的曲目信息的一个 tibble 已预定义为 track_metadata_tbl

  • track_metadata_tbl 中找出 artist_name 列的去重取值。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
编辑并运行代码