Začněte nyníZačněte zdarma

Zkoumání neplatných řádků

Filtrování řádků pomocí joinu ti šlo skvěle – někdy ale potřebuješ neplatná data prozkoumat podrobněji. Taková data můžeš uložit pro pozdější zpracování nebo k ladění datových zdrojů.

Tvým cílem je najít rozdíl mezi dvěma DataFramy a neplatné řádky uložit.

Objekt spark je definovaný a pyspark.sql.functions jsou importovány jako F. Původní DataFrame split_df a joinovaný DataFrame joined_df jsou dostupné ve stejném stavu jako dříve.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Zjisti počty řádků v každém DataFrame.
  • Vytvoř DataFrame obsahující pouze neplatné řádky.
  • Ověř, že počet řádků nového DataFrame odpovídá očekávání.
  • Zjisti počet odstraněných řádků s unikátními hodnotami složek.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
Upravit a spustit kód