Začněte nyníZačněte zdarma

Ověření řádků pomocí joinu

Další způsob filtrování dat je použití joinů k odstranění neplatných záznamů. Potřebuješ ověřit, že názvy složek odpovídají očekávaným hodnotám z DataFramu valid_folders_df. DataFrame split_df je ve stavu, ve kterém jsi ho naposledy nechal/a – obsahuje skupinu rozdělených sloupců.

Objekt spark je k dispozici a pyspark.sql.functions je importován jako F.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Přejmenuj sloupec _c0 na folder v DataFramu valid_folders_df.
  • Zjisti počet řádků v split_df.
  • Spoj oba DataFramy podle názvu složky a výsledný DataFrame pojmenuj joined_df. Nezapomeň použít broadcast na menší DataFrame.
  • Zkontroluj, kolik řádků ve výsledném DataFramu zbylo, a porovnej to s původním počtem.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Upravit a spustit kód