Zacznij terazZacznij za darmo

Kompleksowe testowanie potoku danych

W tym ćwiczeniu będziesz pracować z tym samym potokiem danych co wcześniej – wyodrębnia on, przekształca i ładuje dane podatkowe. Przećwiczysz kompleksowe testowanie tego potoku, aby upewnić się, że można go uruchamiać wielokrotnie bez duplikowania przekształconych danych w pliku parquet.

pandas jest załadowany jako pd, a funkcje extract(), transform() i load() zostały już zdefiniowane.

To ćwiczenie jest częścią kursu

ETL i ELT w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Uruchom potok ETL trzykrotnie, korzystając z pętli for.
  • Wyświetl kształt clean_tax_data w każdej iteracji uruchomienia potoku.
  • Wczytaj DataFrame zapisany w pliku "clean_tax_data.parquet" do zmiennej to_validate.
  • Wyświetl kształt DataFrame to_validate i porównaj go z kształtem clean_tax_rate, aby upewnić się, że dane nie zostały zduplikowane podczas kolejnych uruchomień potoku.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Edytuj i uruchom kod