開始使用免費開始

綜合練習 II

建立一個 DataFrame,套用轉換、將其快取,並檢查是否已被快取。接著,取消快取以釋放記憶體。 本練習已為你建立 spark 工作階段!仔細查看 .explain() 方法的結果,來理解實際的處理流程!

本練習屬於課程

PySpark 入門

檢視課程

練習說明

  • df DataFrame 進行快取。
  • 說明 agg_result DataFrame 的處理流程。
  • 在處理完成後,對已快取的 df DataFrame 執行取消快取(unpersist)。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
編輯並執行程式碼