Doplnění chybějících sloupců
V jednom ze souborů chybí sloupec pub (vydavatel), ale tým chce přesto načíst oba soubory jako jeden dataset. Zvol správný argument, aby Polars místo chyby doplnil null tam, kde sloupec chybí.
polars je načtený jako pl a adresář je uložen v DRIFT_DIR. Záhlaví každého souboru je vypsáno předem, takže vidíš rozdíl ve schématu.
Toto cvičení je součástí kurzu
Scaling and Optimizing Data Pipelines with Polars
Pokyny k cvičení
- Použij glob vzor pro načtení všech souborů
seattle_*.csvzDRIFT_DIR. - Přidej správný argument, aby Polars doplnil hodnoty null pro sloupce, které v některých souborech chybí.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))