Fehlende Spalten einfügen
In einer Jahresdatei fehlt die Spalte pub (Publisher), aber das Team möchte beide Dateien trotzdem als einen Datensatz einlesen. Wähle das richtige Argument, damit Polars null einsetzt, wo eine Spalte fehlt, statt mit einem Fehler abzubrechen.
polars ist als pl geladen, und das Verzeichnis steht in DRIFT_DIR. Der Header jeder Datei wird für dich ausgegeben, damit du den Unterschied im Schema sehen kannst.
Diese Übung ist Teil des Kurses
<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>Übungsanweisungen
- Verwende ein Glob-Muster, um alle
seattle_*.csv-Dateien inDRIFT_DIReinzulesen. - Füge das passende Argument hinzu, damit Polars für in manchen Dateien fehlende Spalten
nulleinsetzt.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))