異なるパーティションでのID
データフレームに ID フィールドを追加し終えました。次は、パーティション数が異なるデータフレームで同じことを行うと何が起きるかを確認してみましょう。
パーティション数を確認するには、データフレームに対して .rdd.getNumPartitions() メソッドを使います。
ワークスペースには spark セッションと 2 つのデータフレーム voter_df と voter_df_single が用意されています。指示に従って両者の違いを見つけていきます。pyspark.sql.functions ライブラリはエイリアス F で使用できます。
この演習はコースの一部です
PySpark でデータをクレンジングする
演習の手順
- それぞれのデータフレームのパーティション数を出力してください。
- それぞれのデータフレームに
ROW_IDフィールドを追加してください。 - 各データフレームで、先頭 10 件の ID を表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)