Bắt đầu ngayBắt đầu miễn phí

Chọn cột

Cách dễ nhất để thao tác với data frame lưu trong Spark là dùng cú pháp dplyr. Chủ đề này được trình bày chi tiết trong các khóa Data Manipulation with dplyrJoining Data with dplyr, nhưng bạn sẽ dành chương rưỡi tiếp theo để đi qua tất cả các điểm quan trọng.

dplyr có năm thao tác chính bạn có thể thực hiện trên một data frame: chọn cột, lọc dòng, sắp xếp thứ tự các dòng, thay đổi hoặc thêm cột mới, và tính các thống kê tổng hợp.

Bắt đầu với việc chọn cột. Bạn thực hiện bằng cách gọi select() với một tibble, theo sau là các tên cột (không đặt trong dấu nháy) mà bạn muốn giữ lại. Các hàm dplyr thường được dùng cùng toán tử pipe của magrittr, %>%. Để chọn các cột x, yz, bạn sẽ viết như sau.

a_tibble %>%
  select(x, y, z)

Lưu ý rằng hiện tại sparklyr không hỗ trợ truy cập bằng ngoặc vuông. Vì vậy bạn không thể làm

a_tibble[, c("x", "y", "z")]

Bài tập này là một phần của khóa học

Nhập môn Spark với sparklyr trong R

Xem khóa học

Hướng dẫn bài tập

Kết nối Spark đã được tạo sẵn dưới tên spark_conn. Một tibble gắn với metadata của track được lưu trong Spark đã được định nghĩa sẵn là track_metadata_tbl.

  • Chọn các cột artist_name, release, titleyear bằng select().
  • Thử làm điều tương tự bằng cách truy cập với ngoặc vuông. Tiết lộ trước! Đoạn mã này sẽ gây lỗi, nên nó được bọc trong lời gọi tới tryCatch().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Chỉnh sửa và Chạy Mã