Testa en datapipeline från start till slut
I den här övningen arbetar du med samma datapipeline som tidigare – en pipeline som extraherar, transformerar och laddar skattedata. Du tränar på att testa pipelinen från start till slut för att säkerställa att den kan köras flera gånger utan att den transformerade datan dupliceras i parquet-filen.
pandas har laddats in som pd, och funktionerna extract(), transform() och load() är redan definierade.
Den här övningen är en del av kursen
ETL och ELT i Python
Övningsinstruktioner
- Kör ETL-pipelinen tre gånger med hjälp av en
for-loop. - Skriv ut formen på
clean_tax_datai varje iteration av pipeline-körningen. - Läs in DataFrame:n som lagrats i filen
"clean_tax_data.parquet"i variabelnto_validate. - Skriv ut formen på DataFrame:n
to_validateoch jämför den med formen påclean_tax_rateför att kontrollera att ingen data duplicerades vid varje pipeline-körning.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")