Bắt đầu ngayBắt đầu miễn phí

Chọn các hàng duy nhất

Nếu bạn có một biến phân loại được lưu trong factor, sẽ hữu ích khi biết các hạng mục cụ thể là gì; bạn làm điều này với hàm levels(). Với một tibble, khái niệm tổng quát hơn là tìm các hàng có dữ liệu duy nhất. Theo thuật ngữ từ SQL, việc này được thực hiện bằng hàm distinct(). Bạn có thể dùng trực tiếp trên tập dữ liệu để tìm các kết hợp duy nhất của một tập cột cụ thể. Ví dụ, để tìm các kết hợp duy nhất của các giá trị trong các cột x, yz, bạn sẽ viết như sau.

a_tibble %>%
  distinct(x, y, z)

Bài tập này là một phần của khóa học

Nhập môn Spark với sparklyr trong R

Xem khóa học

Hướng dẫn bài tập

Kết nối Spark đã được tạo sẵn là spark_conn. Một tibble gắn với siêu dữ liệu track được lưu trong Spark đã được định nghĩa trước là track_metadata_tbl.

  • Tìm các giá trị khác nhau (distinct) của cột artist_name từ track_metadata_tbl.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Chỉnh sửa và Chạy Mã