Unit testování datového pipeline s fixtures
V předchozím videu jsi se dozvěděl/a, že unit testování pomáhá zvýšit důvěryhodnost datového pipeline a odhalit chyby už během vývoje. V tomto cvičení si procvičíš psaní fixtures i unit testů pomocí knihovny pytest a příkazu assert.
Funkce transform, pro kterou budeš unit testy psát, je uvedena níže jako reference. Knihovna pandas je importována jako pd a knihovna pytest je načtena a připravena k použití.
def transform(raw_data):
raw_data["tax_rate"] = raw_data["total_taxes_paid"] / raw_data["total_taxable_income"]
raw_data.set_index("industry_name", inplace=True)
return raw_data
Toto cvičení je součástí kurzu
ETL a ELT v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define a pytest fixture
@pytest.fixture()
____ ____():
raw_data = pd.read_csv("raw_tax_data.csv")
# Transform the raw_data, store in clean_data DataFrame, and return the variable
clean_data = ____
return ____