Tipare arhitecturale pentru pipeline-uri de date
Atunci când construiești pipeline-uri de date, este recomandat să separi fișierele în care sunt definite funcțiile de cele în care acestea sunt executate.
În acest exercițiu, vei exersa importarea componentelor unui pipeline în memorie, după care vei folosi aceste funcții pentru a rula pipeline-ul de la capăt la capăt. Proiectul are următoarea structură, unde pipeline_utils stochează funcțiile extract(), transform() și load() care vor fi folosite pentru a rula pipeline-ul.
> ls
etl_pipeline.py
pipeline_utils.py
Acest exercițiu face parte din cursul
ETL și ELT în Python
Instrucțiuni pentru exercițiu
- Importă funcțiile
extract,transformșiloaddin modululpipeline_utils. - Folosește funcțiile importate pentru a rula pipeline-ul de date de la capăt la capăt.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")