Začněte nyníZačněte zdarma

Načítání více souborů najednou

Data o výpůjčkách jsou teď rozdělena do samostatných CSV souborů podle roku (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Tyto soubory používají starší názvy sloupců usageclass a materialtype. Pomocí vzoru glob načti všechny soubory dohromady jako jeden logický dataset a vytvoř přehled fyzických výpůjček.

polars je načteno jako pl a cesta k adresáři je uložena v MULTIFILE_DIR.

Toto cvičení je součástí kurzu

Scaling and Optimizing Data Pipelines with Polars

Zobrazit kurz

Pokyny k cvičení

  • Pomocí vzoru glob načti všechny soubory seattle_*.csv z adresáře MULTIFILE_DIR.
  • Vyfiltruj z kombinovaného datasetu výpůjčky typu "Physical" a pak proveď grupování podle materialtype.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Upravit a spustit kód