キャッシュの練習:SQL
前回は、2つのDataFrame(df1 と、df1 から作成した df2)を確認しました。そこで df1 はキャッシュしましたが、df2 はキャッシュしませんでした。本演習ではその逆を行い、df2 をキャッシュし、df1 はキャッシュしない場合の効果を見ていきます。
各アクションにかかる時間を再び記録してください。次の演習で比較します。どのタスクが速くなり、どのタスクが遅くなりますか?
この演習はコースの一部です
Pythonで学ぶ Spark SQL 入門
演習の手順
df2をキャッシュし、df1はキャッシュしないでください。df1に対してアクションを1回実行してからもう一度繰り返し、続いてdf2に対してアクションを実行してからもう一度繰り返してください。これはすでに用意されています。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)