結合で行を検証する
無効なエントリを取り除く方法として、結合を使ってフィルタリングする手法があります。与えられた valid_folders_df という DataFrame に基づき、フォルダ名が想定どおりかを検証してください。DataFrame split_df は、前の演習で作成した分割済みの列を持つ状態のままです。
spark オブジェクトが利用可能で、pyspark.sql.functions は F としてインポート済みです。
この演習はコースの一部です
PySpark でデータをクレンジングする
演習の手順
valid_folders_dfDataFrame の_c0列名をfolderにリネームします。split_dfの行数をカウントします。- フォルダ名で 2 つの DataFrame を結合し、結果の DataFrame を
joined_dfと名付けます。小さいほうの DataFrame を必ずブロードキャストしてください。 - 残った行数を確認し、比較します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))