始める無料で始める

すべてを統合する II

DataFrame を作成し、変換を適用してキャッシュした後、キャッシュされているかどうかを確認しましょう。最後にキャッシュを解除して、メモリを解放します。 この演習では、spark セッションがあらかじめ用意されています。.explain() メソッドの出力結果をよく観察して、何が行われているかを理解しましょう。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • df DataFrame をキャッシュします。
  • agg_result DataFrame の処理について説明します。
  • 処理が完了したら、キャッシュ済みの df DataFrame のキャッシュを解除します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
コードを編集して実行