ÎncepețiÎncepe gratuit

Tipare arhitecturale pentru pipeline-uri de date

Atunci când construiești pipeline-uri de date, este recomandat să separi fișierele în care sunt definite funcțiile de cele în care acestea sunt executate.

În acest exercițiu, vei exersa importarea componentelor unui pipeline în memorie, după care vei folosi aceste funcții pentru a rula pipeline-ul de la capăt la capăt. Proiectul are următoarea structură, unde pipeline_utils stochează funcțiile extract(), transform() și load() care vor fi folosite pentru a rula pipeline-ul.

> ls
 etl_pipeline.py
 pipeline_utils.py

Acest exercițiu face parte din cursul

ETL și ELT în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcțiile extract, transform și load din modulul pipeline_utils.
  • Folosește funcțiile importate pentru a rula pipeline-ul de date de la capăt la capăt.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
Editează și rulează codul