開始使用免費開始

以平行化集合建立 RDD

Resilient Distributed Dataset(RDD)是 Spark 的基本抽象。它是不可變、分散式的物件集合。由於 RDD 是 Spark 的基礎且關鍵的資料型別,了解如何建立它非常重要。在這個練習中,你會用一組文字集合,在 PySpark 中建立你的第一個 RDD。

請記得,你的工作環境中已經有可用的 SparkContext sc

本練習屬於課程

使用 PySpark 的 Big Data 基礎

檢視課程

練習說明

  • 從一個「Python 清單」的字詞集合建立名為 RDD 的 RDD。
  • 確認建立的物件是 RDD。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
編輯並執行程式碼