Ověření řádků pomocí joinu
Další způsob filtrování dat je použití joinů k odstranění neplatných záznamů. Potřebuješ ověřit, že názvy složek odpovídají očekávaným hodnotám z DataFramu valid_folders_df. DataFrame split_df je ve stavu, ve kterém jsi ho naposledy nechal/a – obsahuje skupinu rozdělených sloupců.
Objekt spark je k dispozici a pyspark.sql.functions je importován jako F.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Přejmenuj sloupec
_c0nafolderv DataFramuvalid_folders_df. - Zjisti počet řádků v
split_df. - Spoj oba DataFramy podle názvu složky a výsledný DataFrame pojmenuj
joined_df. Nezapomeň použít broadcast na menší DataFrame. - Zkontroluj, kolik řádků ve výsledném DataFramu zbylo, a porovnej to s původním počtem.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))