RDD 轉成 DataFrame
和 RDD 類似,DataFrame 也是 Spark 中不可變且分散式的資料結構。雖然 RDD 是 Spark 的基本資料結構,但在 DataFrame 中處理資料通常比在 RDD 中更容易。因此,了解如何將 RDD 轉換成 DataFrame 很重要。
在這個練習中,你會先使用已提供的 sample_list 建立一個 RDD。這個 RDD 包含一個由多個 tuple 組成的清單:('Mona',20), ('Jennifer',34),('John',20), ('Jim',26),每個 tuple 都包含姓名與年齡。接著,你會用這個 RDD 和綱要(也就是 'Name' 與 'Age' 的清單)建立一個 DataFrame,最後確認輸出是否為 PySpark 的 DataFrame。
記住,你的工作環境中已經有 SparkContext sc 和 SparkSession spark 可以使用。
本練習屬於課程
使用 PySpark 的 Big Data 基礎
練習說明
- 從
sample_list建立一個 RDD。 - 使用上述 RDD 與綱要建立一個 PySpark DataFrame。
- 確認輸出為 PySpark DataFrame。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create an RDD from the list
rdd = sc.____(sample_list)
# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])
# Check the type of names_df
print("The type of names_df is", ____(names_df))