Walidacja potoku danych w „punktach kontrolnych"
W tym ćwiczeniu będziesz pracować z potokiem danych, który wyodrębnia dane podatkowe z pliku CSV, tworzy nową kolumnę, filtruje wiersze na podstawie średniego dochodu podlegającego opodatkowaniu i zapisuje dane do pliku parquet.
Biblioteka pandas została załadowana jako pd, a funkcje extract(), transform() i load() są już zdefiniowane. Użyjesz ich do walidacji potoku danych w różnych punktach kontrolnych podczas jego wykonywania.
To ćwiczenie jest częścią kursu
ETL i ELT w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")