綜合練習 II
建立一個 DataFrame,套用轉換、將其快取,並檢查是否已被快取。接著,取消快取以釋放記憶體。
本練習已為你建立 spark 工作階段!仔細查看 .explain() 方法的結果,來理解實際的處理流程!
本練習屬於課程
PySpark 入門
練習說明
- 將
dfDataFrame 進行快取。 - 說明
agg_resultDataFrame 的處理流程。 - 在處理完成後,對已快取的
dfDataFrame 執行取消快取(unpersist)。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____