Validera en datapipeline vid "kontrollpunkter"
I den här övningen arbetar du med en datapipeline som extraherar skattedata från en CSV-fil, skapar en ny kolumn, filtrerar bort rader baserat på genomsnittlig skattepliktig inkomst och sparar data till en parquet-fil.
pandas har laddats som pd, och funktionerna extract(), transform() och load() är redan definierade. Du använder dessa funktioner för att validera datapipelinen vid olika kontrollpunkter under körningen.
Den här övningen är en del av kursen
ETL och ELT i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")