Tester un pipeline de données de bout en bout
Dans cet exercice, vous utiliserez le même pipeline de données que précédemment, qui extrait, transforme et charge des données fiscales. Vous pratiquerez le test de ce pipeline de bout en bout pour vous assurer que la solution peut être exécutée plusieurs fois sans dupliquer les données transformées dans le fichier parquet.
pandas a été importé sous le nom pd, et les fonctions extract(), transform() et load() ont déjà été définies.
Cette activité fait partie du cours
ETL et ELT en Python
Instructions de l’exercice
- Exécutez le pipeline ETL trois fois à l'aide d'une boucle
for. - Affichez la forme (
shape) declean_tax_dataà chaque itération de l'exécution du pipeline. - Lisez le DataFrame stocké dans le fichier
"clean_tax_data.parquet"dans la variableto_validate. - Affichez la forme du DataFrame
to_validateet comparez-la à celle declean_tax_ratepour confirmer qu'aucune donnée n'a été dupliquée à chaque exécution du pipeline.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")