LoslegenKostenlos starten

Fehlende Spalten einfügen

In einer Jahresdatei fehlt die Spalte pub (Publisher), aber das Team möchte beide Dateien trotzdem als einen Datensatz einlesen. Wähle das richtige Argument, damit Polars null einsetzt, wo eine Spalte fehlt, statt mit einem Fehler abzubrechen.

polars ist als pl geladen, und das Verzeichnis steht in DRIFT_DIR. Der Header jeder Datei wird für dich ausgegeben, damit du den Unterschied im Schema sehen kannst.

Diese Übung ist Teil des Kurses

<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>
Kurs ansehen

Übungsanweisungen

  • Verwende ein Glob-Muster, um alle seattle_*.csv-Dateien in DRIFT_DIR einzulesen.
  • Füge das passende Argument hinzu, damit Polars für in manchen Dateien fehlende Spalten null einsetzt.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
Code bearbeiten und ausführen