ÎncepețiÎncepe gratuit

Validarea unui pipeline de date la „puncte de control"

În acest exercițiu, vei lucra cu un pipeline de date care extrage date fiscale dintr-un fișier CSV, creează o nouă coloană, filtrează rândurile pe baza venitului impozabil mediu și salvează datele într-un fișier parquet.

pandas a fost importat ca pd, iar funcțiile extract(), transform() și load() au fost deja definite. Vei folosi aceste funcții pentru a valida pipeline-ul de date la diverse puncte de control pe parcursul execuției sale.

Acest exercițiu face parte din cursul

ETL și ELT în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)

# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")
Editează și rulează codul