Architektonické vzory datových pipeline
Při budování datových pipeline je osvědčeným postupem oddělovat soubory, ve kterých jsou funkce definovány, od těch, ve kterých se spouštějí.
V tomto cvičení si procvičíš import komponent pipeline do paměti a jejich využití ke spuštění pipeline od začátku do konce. Projekt má následující strukturu – soubor pipeline_utils obsahuje funkce extract(), transform() a load(), které se použijí ke spuštění pipeline.
> ls
etl_pipeline.py
pipeline_utils.py
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Pokyny k cvičení
- Importuj funkce
extract,transformaloadz modulupipeline_utils. - Pomocí importovaných funkcí spusť datovou pipeline od začátku do konce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")