始める無料で始める

キャッシュの練習:SQL

前回は、2つのDataFrame(df1 と、df1 から作成した df2)を確認しました。そこで df1 はキャッシュしましたが、df2 はキャッシュしませんでした。本演習ではその逆を行い、df2 をキャッシュし、df1 はキャッシュしない場合の効果を見ていきます。

各アクションにかかる時間を再び記録してください。次の演習で比較します。どのタスクが速くなり、どのタスクが遅くなりますか?

この演習はコースの一部です

Pythonで学ぶ Spark SQL 入門

コースを見る

演習の手順

  • df2 をキャッシュし、df1 はキャッシュしないでください。
  • df1 に対してアクションを1回実行してからもう一度繰り返し、続いて df2 に対してアクションを実行してからもう一度繰り返してください。これはすでに用意されています。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
コードを編集して実行