Testarea unui pipeline de date end-to-end
În acest exercițiu, vei lucra cu același pipeline de date ca înainte, care extrage, transformă și încarcă date fiscale. Vei exersa testarea acestui pipeline end-to-end pentru a te asigura că soluția poate fi rulată de mai multe ori, fără a duplica datele transformate în fișierul parquet.
pandas a fost importat ca pd, iar funcțiile extract(), transform() și load() au fost deja definite.
Acest exercițiu face parte din cursul
ETL și ELT în Python
Instrucțiuni pentru exercițiu
- Rulează pipeline-ul ETL de trei ori, folosind o buclă
for. - Afișează dimensiunea (
shape) variabileiclean_tax_datala fiecare iterație a execuției pipeline-ului. - Citește DataFrame-ul stocat în fișierul
"clean_tax_data.parquet"în variabilato_validate. - Afișează dimensiunea DataFrame-ului
to_validateși compar-o cu dimensiunea variabileiclean_tax_ratepentru a te asigura că datele nu au fost duplicate la fiecare rulare a pipeline-ului.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")