Modèles d'architecture de pipeline de données
Lors de la création de pipelines de données, il est préférable de séparer les fichiers où les fonctions sont définies de ceux où elles sont exécutées.
Dans cet exercice, vous allez vous exercer à importer en mémoire des composants d'un pipeline avant d'utiliser ces fonctions pour exécuter le pipeline de bout en bout. Le projet a le format suivant, où pipeline_utils contient les fonctions extract(), transform(), et load() qui serviront à exécuter le pipeline.
> ls
etl_pipeline.py
pipeline_utils.py
Cette activité fait partie du cours
ETL et ELT en Python
Instructions de l’exercice
- Importez les fonctions
extract,transformetloaddu modulepipeline_utils. - Utilisez les fonctions importées pour exécuter le pipeline de données de bout en bout.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")