Validera rader via join
Ett annat sätt att filtrera data är att använda joins för att ta bort ogiltiga poster. Du behöver verifiera att mappnamnen stämmer överens med de förväntade värdena i en DataFrame med namnet valid_folders_df. DataFrame:n split_df är i samma skick som du lämnade den, med en grupp uppdelade kolumner.
Objektet spark är tillgängligt och pyspark.sql.functions är importerat som F.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Byt namn på kolumnen
_c0tillfolderi DataFrame:nvalid_folders_df. - Räkna antalet rader i
split_df. - Sammanfoga de två DataFrame:arna på mappnamnet och ge den resulterande DataFrame:n namnet
joined_df. Se till att använda broadcast på den mindre DataFrame:n. - Kontrollera hur många rader som finns kvar i DataFrame:n och jämför resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))