建立 RDD
在 PySpark 中,你可以用好幾種方式建立 RDD(Resilient Distributed Dataset,具彈性的分散式資料集)。由於你已經熟悉 DataFrame,這裡會用 DataFrame 來設定。請記得,你的工作環境中已經有一個名為 spark 的 SparkSession!
本練習屬於課程
PySpark 入門
練習說明
- 從提供的清單建立一個名為
df的 DataFrame。 - 將該 DataFrame 轉換為 RDD。
- 收集並列印產生的 RDD。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)
# Convert DataFrame to RDD
rdd = df.____
# Show the RDD's contents
rdd.____
print(rdd)