Tạo RDD từ bộ sưu tập được song song hóa
Resilient Distributed Dataset (RDD) là trừu tượng cơ bản trong Spark. Đây là một tập hợp các đối tượng được phân tán và bất biến. Vì RDD là kiểu dữ liệu nền tảng và xương sống của Spark, nên việc hiểu cách tạo nó là rất quan trọng. Trong bài tập này, bạn sẽ tạo RDD đầu tiên trong PySpark từ một tập hợp các từ.
Lưu ý: bạn đã có sẵn SparkContext sc trong không gian làm việc.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- Tạo một RDD tên
RDDtừ danh sách Python các từ. - Xác nhận đối tượng được tạo là RDD.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))