Začněte nyníZačněte zdarma

Doplnění chybějících sloupců

V jednom ze souborů chybí sloupec pub (vydavatel), ale tým chce přesto načíst oba soubory jako jeden dataset. Zvol správný argument, aby Polars místo chyby doplnil null tam, kde sloupec chybí.

polars je načtený jako pl a adresář je uložen v DRIFT_DIR. Záhlaví každého souboru je vypsáno předem, takže vidíš rozdíl ve schématu.

Toto cvičení je součástí kurzu

Scaling and Optimizing Data Pipelines with Polars

Zobrazit kurz

Pokyny k cvičení

  • Použij glob vzor pro načtení všech souborů seattle_*.csv z DRIFT_DIR.
  • Přidej správný argument, aby Polars doplnil hodnoty null pro sloupce, které v některých souborech chybí.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
Upravit a spustit kód