Chọn các hàng duy nhất
Nếu bạn có một biến phân loại được lưu trong factor, sẽ hữu ích khi biết các hạng mục cụ thể là gì; bạn làm điều này với hàm levels(). Với một tibble, khái niệm tổng quát hơn là tìm các hàng có dữ liệu duy nhất. Theo thuật ngữ từ SQL, việc này được thực hiện bằng hàm distinct(). Bạn có thể dùng trực tiếp trên tập dữ liệu để tìm các kết hợp duy nhất của một tập cột cụ thể. Ví dụ, để tìm các kết hợp duy nhất của các giá trị trong các cột x, y và z, bạn sẽ viết như sau.
a_tibble %>%
distinct(x, y, z)
Bài tập này là một phần của khóa học
Nhập môn Spark với sparklyr trong R
Hướng dẫn bài tập
Kết nối Spark đã được tạo sẵn là spark_conn. Một tibble gắn với siêu dữ liệu track được lưu trong Spark đã được định nghĩa trước là track_metadata_tbl.
- Tìm các giá trị khác nhau (distinct) của cột
artist_nametừtrack_metadata_tbl.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___