始める無料で始める

結合で行を検証する

無効なエントリを取り除く方法として、結合を使ってフィルタリングする手法があります。与えられた valid_folders_df という DataFrame に基づき、フォルダ名が想定どおりかを検証してください。DataFrame split_df は、前の演習で作成した分割済みの列を持つ状態のままです。

spark オブジェクトが利用可能で、pyspark.sql.functionsF としてインポート済みです。

この演習はコースの一部です

PySpark でデータをクレンジングする

コースを見る

演習の手順

  • valid_folders_df DataFrame の _c0 列名を folder にリネームします。
  • split_df の行数をカウントします。
  • フォルダ名で 2 つの DataFrame を結合し、結果の DataFrame を joined_df と名付けます。小さいほうの DataFrame を必ずブロードキャストしてください。
  • 残った行数を確認し、比較します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
コードを編集して実行