Začněte nyníZačněte zdarma

Testování datového pipeline od začátku do konce

V tomto cvičení budeš pracovat se stejným datovým pipeline jako předtím – extrahuje, transformuje a načítá daňová data. Procvičíš si testování celého pipeline od začátku do konce, abys ověřil/a, že ho lze spustit opakovaně, aniž by docházelo ke zdvojování transformovaných dat v parquet souboru.

pandas je načten jako pd a funkce extract(), transform() a load() jsou již definovány.

Toto cvičení je součástí kurzu

ETL a ELT v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Spusť ETL pipeline třikrát pomocí cyklu for.
  • V každé iteraci spuštění pipeline vypiš tvar clean_tax_data.
  • Načti DataFrame uložený v souboru "clean_tax_data.parquet" do proměnné to_validate.
  • Vypiš tvar DataFrame to_validate a porovnej ho s tvarem clean_tax_rate, abys ověřil/a, že při každém spuštění pipeline nedošlo ke zdvojování dat.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Upravit a spustit kód