Kom igångKom igång gratis

Testa en datapipeline från start till slut

I den här övningen arbetar du med samma datapipeline som tidigare – en pipeline som extraherar, transformerar och laddar skattedata. Du tränar på att testa pipelinen från start till slut för att säkerställa att den kan köras flera gånger utan att den transformerade datan dupliceras i parquet-filen.

pandas har laddats in som pd, och funktionerna extract(), transform() och load() är redan definierade.

Den här övningen är en del av kursen

ETL och ELT i Python

Visa kurs

Övningsinstruktioner

  • Kör ETL-pipelinen tre gånger med hjälp av en for-loop.
  • Skriv ut formen på clean_tax_data i varje iteration av pipeline-körningen.
  • Läs in DataFrame:n som lagrats i filen "clean_tax_data.parquet" i variabeln to_validate.
  • Skriv ut formen på DataFrame:n to_validate och jämför den med formen på clean_tax_rate för att kontrollera att ingen data duplicerades vid varje pipeline-körning.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Redigera och kör kod