CommencezCommencez gratuitement

Modèles d'architecture de pipeline de données

Lors de la création de pipelines de données, il est préférable de séparer les fichiers où les fonctions sont définies de ceux où elles sont exécutées.

Dans cet exercice, vous allez vous exercer à importer en mémoire des composants d'un pipeline avant d'utiliser ces fonctions pour exécuter le pipeline de bout en bout. Le projet a le format suivant, où pipeline_utils contient les fonctions extract(), transform(), et load() qui serviront à exécuter le pipeline.

> ls
 etl_pipeline.py
 pipeline_utils.py

Cette activité fait partie du cours

ETL et ELT en Python

Voir le cours

Instructions de l’exercice

  • Importez les fonctions extract, transform et load du module pipeline_utils.
  • Utilisez les fonctions importées pour exécuter le pipeline de données de bout en bout.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
Modifier et exécuter le code