Spark の設定を書き換える
クラスター上の Spark 設定を確認したので、ニーズに合わせてチューニングできるよう、いくつかの設定を変更してみましょう。変更がクラスターに反映されたかを確認するために、データを読み込みます。
Spark の設定は初期状態ではパーティション数 200 に設定されています。
spark オブジェクトは利用可能です。departures.txt.gz というファイルがインポート用に用意されています。departures.txt.gz から重複を除いた行を含む初期の DataFrame は departures_df として利用できます。
この演習はコースの一部です
PySpark でデータをクレンジングする
演習の手順
departures_dfのパーティション数をbeforeという変数に保存します。spark.sql.shuffle.partitionsの設定をパーティション数 500 に変更します。- 出発データのファイルから重複を除いた行を読み込み、
departures_dfDataFrame を再作成します。 - 設定変更の前後でのパーティション数を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)