Kom igångKom igång gratis

Infoga saknade kolumner

En av de extraherade filerna saknar kolumnen pub (utgivare), men teamet vill ändå läsa in båda filerna som ett enda dataset. Välj rätt argument så att Polars infogar null där en kolumn saknas, i stället för att misslyckas.

polars är importerat som pl och katalogen finns i DRIFT_DIR. Rubriken för varje fil skrivs ut åt dig så att du kan se skillnaden i schema.

Den här övningen är en del av kursen

Skalning och optimering av datapipelines med Polars

Visa kurs

Övningsinstruktioner

  • Använd ett glob-mönster för att skanna alla seattle_*.csv-filer i DRIFT_DIR.
  • Lägg till rätt argument så att Polars infogar null-värden för kolumner som saknas i vissa filer.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
Redigera och kör kod