Validace datového pipeline v "kontrolních bodech"
V tomto cvičení budeš pracovat s datovým pipeline, který extrahuje daňová data z CSV souboru, vytváří nový sloupec, filtruje řádky podle průměrného zdanitelného příjmu a ukládá data do souboru ve formátu parquet.
pandas je načten jako pd a funkce extract(), transform() a load() jsou již definovány. Tyto funkce použiješ k ověření datového pipeline v různých kontrolních bodech průběhu jeho spuštění.
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")