ÎncepețiÎncepe gratuit

Testarea unui pipeline de date end-to-end

În acest exercițiu, vei lucra cu același pipeline de date ca înainte, care extrage, transformă și încarcă date fiscale. Vei exersa testarea acestui pipeline end-to-end pentru a te asigura că soluția poate fi rulată de mai multe ori, fără a duplica datele transformate în fișierul parquet.

pandas a fost importat ca pd, iar funcțiile extract(), transform() și load() au fost deja definite.

Acest exercițiu face parte din cursul

ETL și ELT în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Rulează pipeline-ul ETL de trei ori, folosind o buclă for.
  • Afișează dimensiunea (shape) variabilei clean_tax_data la fiecare iterație a execuției pipeline-ului.
  • Citește DataFrame-ul stocat în fișierul "clean_tax_data.parquet" în variabila to_validate.
  • Afișează dimensiunea DataFrame-ului to_validate și compar-o cu dimensiunea variabilei clean_tax_rate pentru a te asigura că datele nu au fost duplicate la fiecare rulare a pipeline-ului.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Editează și rulează codul