Arkitekturmönster för datapipelines
När du bygger datapipelines är det bra att separera filerna där funktioner definieras från filerna där de körs.
I den här övningen får du öva på att importera komponenter från en pipeline till minnet och sedan använda dessa funktioner för att köra pipelinen från start till slut. Projektet har följande struktur, där pipeline_utils innehåller funktionerna extract(), transform() och load() som används för att köra pipelinen.
> ls
etl_pipeline.py
pipeline_utils.py
Den här övningen är en del av kursen
ETL och ELT i Python
Övningsinstruktioner
- Importera funktionerna
extract,transformochloadfrån modulenpipeline_utils. - Använd de importerade funktionerna för att köra datapipelinen från start till slut.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")