始める無料で始める

Spark の設定を書き換える

クラスター上の Spark 設定を確認したので、ニーズに合わせてチューニングできるよう、いくつかの設定を変更してみましょう。変更がクラスターに反映されたかを確認するために、データを読み込みます。

Spark の設定は初期状態ではパーティション数 200 に設定されています。

spark オブジェクトは利用可能です。departures.txt.gz というファイルがインポート用に用意されています。departures.txt.gz から重複を除いた行を含む初期の DataFrame は departures_df として利用できます。

この演習はコースの一部です

PySpark でデータをクレンジングする

コースを見る

演習の手順

  • departures_df のパーティション数を before という変数に保存します。
  • spark.sql.shuffle.partitions の設定をパーティション数 500 に変更します。
  • 出発データのファイルから重複を除いた行を読み込み、departures_df DataFrame を再作成します。
  • 設定変更の前後でのパーティション数を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
コードを編集して実行