Tester un pipeline de données avec des fixtures
Dans la dernière vidéo, vous avez vu que les tests unitaires aident à renforcer la confiance envers votre pipeline de données et peuvent même permettre de repérer des bogues tout au long du développement. Dans cet exercice, vous allez vous exercer à écrire des fixtures et des tests unitaires, en utilisant la bibliothèque pytest et assert.
La fonction transform autour de laquelle vous allez créer des tests unitaires est présentée ci-dessous à titre de référence. pandas a été importé sous le nom pd, et la bibliothèque pytest() est chargée et prête à l'emploi.
def transform(raw_data):
raw_data["tax_rate"] = raw_data["total_taxes_paid"] / raw_data["total_taxable_income"]
raw_data.set_index("industry_name", inplace=True)
return raw_data
Cette activité fait partie du cours
ETL et ELT en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define a pytest fixture
@pytest.fixture()
____ ____():
raw_data = pd.read_csv("raw_tax_data.csv")
# Transform the raw_data, store in clean_data DataFrame, and return the variable
clean_data = ____
return ____