Zacznij terazZacznij za darmo

Walidacja potoku danych w „punktach kontrolnych"

W tym ćwiczeniu będziesz pracować z potokiem danych, który wyodrębnia dane podatkowe z pliku CSV, tworzy nową kolumnę, filtruje wiersze na podstawie średniego dochodu podlegającego opodatkowaniu i zapisuje dane do pliku parquet.

Biblioteka pandas została załadowana jako pd, a funkcje extract(), transform() i load() są już zdefiniowane. Użyjesz ich do walidacji potoku danych w różnych punktach kontrolnych podczas jego wykonywania.

To ćwiczenie jest częścią kursu

ETL i ELT w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)

# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")
Edytuj i uruchom kod