始める無料で始める

Spark UIでキャッシュを確認する

データフレーム partitioned_df が用意されています。これは一時テーブル text を登録するために使われます。その後、spark.catalog.cacheTable('text') を使って text をキャッシュします。Spark をローカルで実行している場合、Spark UI は http://localhost:4040/storage/ で確認できます。本演習では、次の画像を見てください。これは text のキャッシュが読み込まれた後に Spark UI に表示される内容です。

Spark UI Storage

これは、7つのパーティションを持つ text というテーブルがメモリにキャッシュされていることを示しています。次のうち、どれを実行すると直ちに上記の表示が Spark UI に現れますか?

  1. 基になるデータフレームに変換を行う。例: df = partitioned_df.distinct()

  2. 基になるデータフレームをカウントする。例: partitioned_df.count()

  3. テーブルに対してクエリを実行する。例: spark.sql("select count(*) from text")

  4. クエリを実行して結果を表示する。例: spark.sql("select count(*) from text").show()

この演習はコースの一部です

Pythonで学ぶ Spark SQL 入門

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する