Zkoumání neplatných řádků
Filtrování řádků pomocí joinu ti šlo skvěle – někdy ale potřebuješ neplatná data prozkoumat podrobněji. Taková data můžeš uložit pro pozdější zpracování nebo k ladění datových zdrojů.
Tvým cílem je najít rozdíl mezi dvěma DataFramy a neplatné řádky uložit.
Objekt spark je definovaný a pyspark.sql.functions jsou importovány jako F. Původní DataFrame split_df a joinovaný DataFrame joined_df jsou dostupné ve stejném stavu jako dříve.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Zjisti počty řádků v každém DataFrame.
- Vytvoř DataFrame obsahující pouze neplatné řádky.
- Ověř, že počet řádků nového DataFrame odpovídá očekávání.
- Zjisti počet odstraněných řádků s unikátními hodnotami složek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)