Načítání více souborů najednou
Data o výpůjčkách jsou teď rozdělena do samostatných CSV souborů podle roku (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Tyto soubory používají starší názvy sloupců usageclass a materialtype. Pomocí vzoru glob načti všechny soubory dohromady jako jeden logický dataset a vytvoř přehled fyzických výpůjček.
polars je načteno jako pl a cesta k adresáři je uložena v MULTIFILE_DIR.
Toto cvičení je součástí kurzu
Scaling and Optimizing Data Pipelines with Polars
Pokyny k cvičení
- Pomocí vzoru glob načti všechny soubory
seattle_*.csvz adresářeMULTIFILE_DIR. - Vyfiltruj z kombinovaného datasetu výpůjčky typu
"Physical"a pak proveď grupování podlematerialtype.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)