開始使用免費開始

建立 RDD

在 PySpark 中,你可以用好幾種方式建立 RDD(Resilient Distributed Dataset,具彈性的分散式資料集)。由於你已經熟悉 DataFrame,這裡會用 DataFrame 來設定。請記得,你的工作環境中已經有一個名為 sparkSparkSession

本練習屬於課程

PySpark 入門

檢視課程

練習說明

  • 從提供的清單建立一個名為 df 的 DataFrame。
  • 將該 DataFrame 轉換為 RDD。
  • 收集並列印產生的 RDD。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a DataFrame
df = spark.____("salaries.csv", header=True, inferSchema=True)

# Convert DataFrame to RDD
rdd = df.____

# Show the RDD's contents
rdd.____
print(rdd)
編輯並執行程式碼