Bắt đầu ngayBắt đầu miễn phí

Tóm tắt các cột

Hàm mutate() mà bạn đã thấy ở bài tập trước nhận các cột làm đầu vào và trả về một cột. Nếu bạn tính các thống kê tóm tắt như trung bình, giá trị lớn nhất, hoặc độ lệch chuẩn, thì thường bạn muốn lấy các cột làm đầu vào nhưng trả về một giá trị duy nhất. Điều này được thực hiện với hàm summarize().

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

Lưu ý rằng dplyr có triết lý (được truyền cho sparklyr) là luôn giữ dữ liệu ở dạng tibble. Vì vậy, giá trị trả về ở đây là một tibble với một hàng và một cột cho mỗi thống kê tóm tắt đã được tính.

Bài tập này là một phần của khóa học

Nhập môn Spark với sparklyr trong R

Xem khóa học

Hướng dẫn bài tập

Kết nối Spark đã được tạo sẵn cho bạn dưới tên spark_conn. Một tibble trỏ tới metadata của track được lưu trong Spark đã được định nghĩa trước là track_metadata_tbl.

  • Chọn các trường titleduration.
  • Pipe kết quả để tạo một trường mới duration_minutes chứa thời lượng track theo phút.
  • Pipe kết quả này vào summarize() để tính thời lượng trung bình theo phút, trong một trường tên là mean_duration_minutes.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Chỉnh sửa và Chạy Mã