Enhetstestning av en datapipeline med fixtures
Du har i det senaste videoavsnittet lärt dig att enhetstestning kan öka tillförlitligheten i din datapipeline och hjälpa till att fånga upp buggar under utvecklingens gång. I den här övningen övar du på att skriva både fixtures och enhetstester med hjälp av biblioteket pytest och assert.
Funktionen transform som du ska skriva enhetstester kring visas nedan som referens. pandas har importerats som pd, och biblioteket pytest() är inläst och redo att använda.
def transform(raw_data):
raw_data["tax_rate"] = raw_data["total_taxes_paid"] / raw_data["total_taxable_income"]
raw_data.set_index("industry_name", inplace=True)
return raw_data
Den här övningen är en del av kursen
ETL och ELT i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define a pytest fixture
@pytest.fixture()
____ ____():
raw_data = pd.read_csv("raw_tax_data.csv")
# Transform the raw_data, store in clean_data DataFrame, and return the variable
clean_data = ____
return ____