CommencezCommencez gratuitement

Tester un pipeline de données de bout en bout

Dans cet exercice, vous utiliserez le même pipeline de données que précédemment, qui extrait, transforme et charge des données fiscales. Vous pratiquerez le test de ce pipeline de bout en bout pour vous assurer que la solution peut être exécutée plusieurs fois sans dupliquer les données transformées dans le fichier parquet.

pandas a été importé sous le nom pd, et les fonctions extract(), transform() et load() ont déjà été définies.

Cette activité fait partie du cours

ETL et ELT en Python

Voir le cours

Instructions de l’exercice

  • Exécutez le pipeline ETL trois fois à l'aide d'une boucle for.
  • Affichez la forme (shape) de clean_tax_data à chaque itération de l'exécution du pipeline.
  • Lisez le DataFrame stocké dans le fichier "clean_tax_data.parquet" dans la variable to_validate.
  • Affichez la forme du DataFrame to_validate et comparez-la à celle de clean_tax_rate pour confirmer qu'aucune donnée n'a été dupliquée à chaque exécution du pipeline.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
Modifier et exécuter le code