すべてを統合する II
DataFrame を作成し、変換を適用してキャッシュした後、キャッシュされているかどうかを確認しましょう。最後にキャッシュを解除して、メモリを解放します。
この演習では、spark セッションがあらかじめ用意されています。.explain() メソッドの出力結果をよく観察して、何が行われているかを理解しましょう。
この演習はコースの一部です
PySpark 入門
演習の手順
dfDataFrame をキャッシュします。agg_resultDataFrame の処理について説明します。- 処理が完了したら、キャッシュ済みの
dfDataFrame のキャッシュを解除します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____