始める無料で始める

異なるパーティションでのID

データフレームに ID フィールドを追加し終えました。次は、パーティション数が異なるデータフレームで同じことを行うと何が起きるかを確認してみましょう。

パーティション数を確認するには、データフレームに対して .rdd.getNumPartitions() メソッドを使います。

ワークスペースには spark セッションと 2 つのデータフレーム voter_dfvoter_df_single が用意されています。指示に従って両者の違いを見つけていきます。pyspark.sql.functions ライブラリはエイリアス F で使用できます。

この演習はコースの一部です

PySpark でデータをクレンジングする

コースを見る

演習の手順

  • それぞれのデータフレームのパーティション数を出力してください。
  • それぞれのデータフレームに ROW_ID フィールドを追加してください。
  • 各データフレームで、先頭 10 件の ID を表示してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
コードを編集して実行