Validarea unui pipeline de date la „puncte de control"
În acest exercițiu, vei lucra cu un pipeline de date care extrage date fiscale dintr-un fișier CSV, creează o nouă coloană, filtrează rândurile pe baza venitului impozabil mediu și salvează datele într-un fișier parquet.
pandas a fost importat ca pd, iar funcțiile extract(), transform() și load() au fost deja definite. Vei folosi aceste funcții pentru a valida pipeline-ul de date la diverse puncte de control pe parcursul execuției sale.
Acest exercițiu face parte din cursul
ETL și ELT în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")