Infoga saknade kolumner
En av de extraherade filerna saknar kolumnen pub (utgivare), men teamet vill ändå läsa in båda filerna som ett enda dataset. Välj rätt argument så att Polars infogar null där en kolumn saknas, i stället för att misslyckas.
polars är importerat som pl och katalogen finns i DRIFT_DIR. Rubriken för varje fil skrivs ut åt dig så att du kan se skillnaden i schema.
Den här övningen är en del av kursen
Skalning och optimering av datapipelines med Polars
Övningsinstruktioner
- Använd ett glob-mönster för att skanna alla
seattle_*.csv-filer iDRIFT_DIR. - Lägg till rätt argument så att Polars infogar null-värden för kolumner som saknas i vissa filer.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))