Začněte nyníZačněte zdarma

Validace datového pipeline v "kontrolních bodech"

V tomto cvičení budeš pracovat s datovým pipeline, který extrahuje daňová data z CSV souboru, vytváří nový sloupec, filtruje řádky podle průměrného zdanitelného příjmu a ukládá data do souboru ve formátu parquet.

pandas je načten jako pd a funkce extract(), transform() a load() jsou již definovány. Tyto funkce použiješ k ověření datového pipeline v různých kontrolních bodech průběhu jeho spuštění.

Toto cvičení je součástí kurzu

ETL a ELT v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)

# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")
Upravit a spustit kód