選取不重複的列
如果你有一個以 factor 儲存的類別型變數,常常會需要知道各個類別為何;你可以用 levels() 函式取得。對於 tibble,更一般的做法是找出資料列中不重複的資料。沿用 SQL 的術語,這可以用 distinct() 函式完成。你可以直接在資料集上使用它,找出特定欄位組合的不重複組合。例如,若要找出 x、y 和 z 欄位值的不重複組合,可以這樣寫:
a_tibble %>%
distinct(x, y, z)
本練習屬於課程
使用 R 的 sparklyr:Spark 入門
練習說明
系統已替你建立名為 spark_conn 的 Spark 連線。連結到儲存在 Spark 中之曲目中繼資料的 tibble 已預先定義為 track_metadata_tbl。
- 從
track_metadata_tbl取出artist_name欄位的不重複值。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___