開始使用免費開始

選取不重複的列

如果你有一個以 factor 儲存的類別型變數,常常會需要知道各個類別為何;你可以用 levels() 函式取得。對於 tibble,更一般的做法是找出資料列中不重複的資料。沿用 SQL 的術語,這可以用 distinct() 函式完成。你可以直接在資料集上使用它,找出特定欄位組合的不重複組合。例如,若要找出 xyz 欄位值的不重複組合,可以這樣寫:

a_tibble %>%
  distinct(x, y, z)

本練習屬於課程

使用 R 的 sparklyr:Spark 入門

檢視課程

練習說明

系統已替你建立名為 spark_conn 的 Spark 連線。連結到儲存在 Spark 中之曲目中繼資料的 tibble 已預先定義為 track_metadata_tbl

  • track_metadata_tbl 取出 artist_name 欄位的不重複值。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
編輯並執行程式碼