以平行化集合建立 RDD
Resilient Distributed Dataset(RDD)是 Spark 的基本抽象。它是不可變、分散式的物件集合。由於 RDD 是 Spark 的基礎且關鍵的資料型別,了解如何建立它非常重要。在這個練習中,你會用一組文字集合,在 PySpark 中建立你的第一個 RDD。
請記得,你的工作環境中已經有可用的 SparkContext sc。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 從一個「Python 清單」的字詞集合建立名為
RDD的 RDD。 - 確認建立的物件是 RDD。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))