Testování datového pipeline od začátku do konce
V tomto cvičení budeš pracovat se stejným datovým pipeline jako předtím – extrahuje, transformuje a načítá daňová data. Procvičíš si testování celého pipeline od začátku do konce, abys ověřil/a, že ho lze spustit opakovaně, aniž by docházelo ke zdvojování transformovaných dat v parquet souboru.
pandas je načten jako pd a funkce extract(), transform() a load() jsou již definovány.
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Pokyny k cvičení
- Spusť ETL pipeline třikrát pomocí cyklu
for. - V každé iteraci spuštění pipeline vypiš tvar
clean_tax_data. - Načti DataFrame uložený v souboru
"clean_tax_data.parquet"do proměnnéto_validate. - Vypiš tvar DataFrame
to_validatea porovnej ho s tvaremclean_tax_rate, abys ověřil/a, že při každém spuštění pipeline nedošlo ke zdvojování dat.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")