Bắt đầu ngayBắt đầu miễn phí

Tạo RDD từ bộ sưu tập được song song hóa

Resilient Distributed Dataset (RDD) là trừu tượng cơ bản trong Spark. Đây là một tập hợp các đối tượng được phân tán và bất biến. Vì RDD là kiểu dữ liệu nền tảng và xương sống của Spark, nên việc hiểu cách tạo nó là rất quan trọng. Trong bài tập này, bạn sẽ tạo RDD đầu tiên trong PySpark từ một tập hợp các từ.

Lưu ý: bạn đã có sẵn SparkContext sc trong không gian làm việc.

Bài tập này là một phần của khóa học

Nền tảng Big Data với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tạo một RDD tên RDD từ danh sách Python các từ.
  • Xác nhận đối tượng được tạo là RDD.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Chỉnh sửa và Chạy Mã