Kom igångKom igång gratis

Validera rader via join

Ett annat sätt att filtrera data är att använda joins för att ta bort ogiltiga poster. Du behöver verifiera att mappnamnen stämmer överens med de förväntade värdena i en DataFrame med namnet valid_folders_df. DataFrame:n split_df är i samma skick som du lämnade den, med en grupp uppdelade kolumner.

Objektet spark är tillgängligt och pyspark.sql.functions är importerat som F.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Byt namn på kolumnen _c0 till folder i DataFrame:n valid_folders_df.
  • Räkna antalet rader i split_df.
  • Sammanfoga de två DataFrame:arna på mappnamnet och ge den resulterande DataFrame:n namnet joined_df. Se till att använda broadcast på den mindre DataFrame:n.
  • Kontrollera hur många rader som finns kvar i DataFrame:n och jämför resultatet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Redigera och kör kod