Bắt đầu ngayBắt đầu miễn phí

Thu thập dữ liệu từ Spark về R

Trong bài “Khám phá cấu trúc của tibble” ở Chương 1, bạn đã thấy rằng tibble không lưu một bản sao dữ liệu. Thay vào đó, dữ liệu nằm trong Spark, và tibble chỉ lưu thông tin về những gì nó muốn truy xuất từ Spark.

Có rất nhiều lý do bạn có thể muốn chuyển dữ liệu từ Spark sang R. Bạn đã thấy một phần dữ liệu được chuyển từ Spark sang R khi in ra. Bạn cũng cần thu thập (collect) toàn bộ tập dữ liệu nếu muốn vẽ biểu đồ hoặc dùng kỹ thuật mô hình hóa không có sẵn trong Spark. (Xét cho cùng, R có bộ sưu tập mô hình phong phú nhất trong các ngôn ngữ lập trình.)

Để thu thập dữ liệu — tức là chuyển dữ liệu từ Spark về R — bạn gọi collect().

Bài tập này là một phần của khóa học

Nhập môn Spark với sparklyr trong R

Xem khóa học

Hướng dẫn bài tập

Kết nối Spark đã được tạo sẵn là spark_conn. Một tibble gắn với metadata của bản nhạc được lưu trong Spark đã được định nghĩa trước là track_metadata_tbl.

  • Lọc các dòng của track_metadata_tbl nơi artist_familiarity lớn hơn 0.9, gán kết quả vào results.
  • In lớp (class) của results, lưu ý rằng đó là tbl_lazy (dùng cho dữ liệu từ xa).
  • Thu thập kết quả của bạn, gán vào collected.
  • In lớp (class) của collected, lưu ý rằng đó là tbl_df (dùng cho dữ liệu cục bộ).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Chỉnh sửa và Chạy Mã