Thay đổi (mutate) các cột
Có thể bạn sẽ bất ngờ, nhưng không phải bộ dữ liệu nào cũng “sạch” ngay từ đầu! Thường bạn cần chỉnh lại giá trị hoặc tạo các cột mới dựa trên dữ liệu hiện có. Quá trình thay đổi hoặc thêm cột được gọi là mutation trong thuật ngữ của dplyr, và được thực hiện bằng mutate(). Hàm này nhận một tibble và các đối số có tên để cập nhật cột. Tên của mỗi đối số chính là tên cột cần thay đổi hoặc thêm mới, và giá trị là một biểu thức mô tả cách cập nhật. Ví dụ, với một tibble có các cột x và y, đoạn mã sau sẽ cập nhật x và tạo cột mới z.
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
Trong trường hợp bạn vẫn còn nhầm rằng các hàm base R hoạt động với Spark tibbles: bạn không thể dùng within() hoặc transform() cho mục đích này.
Bài tập này là một phần của khóa học
Nhập môn Spark với sparklyr trong R
Hướng dẫn bài tập
Một kết nối Spark đã được tạo sẵn cho bạn là spark_conn. Một tibble gắn với track metadata lưu trong Spark đã được định nghĩa trước là track_metadata_tbl.
- Chọn các trường
titlevàduration. Lưu ý thời lượng đang tính bằng giây. - Pipe kết quả này vào
mutate()để tạo trường mớiduration_minuteschứa thời lượng bản nhạc tính theo phút.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___