Scanarea mai multor fișiere
Datele de împrumut ale echipei sunt acum împărțite într-un fișier CSV pe an (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Aceste fișiere anuale folosesc denumirile vechi de coloane usageclass și materialtype. Folosește un șablon glob pentru a scana toate fișierele împreună ca un singur set de date logic, apoi construiește un rezumat al împrumuturilor fizice.
polars este importat ca pl, iar directorul se află în MULTIFILE_DIR.
Acest exercițiu face parte din cursul
Scalarea și optimizarea pipeline-urilor de date cu Polars
Instrucțiuni pentru exercițiu
- Scanează toate fișierele
seattle_*.csvdinMULTIFILE_DIRfolosind un șablon glob. - Filtrează setul de date combinat pentru împrumuturile de tip
"Physical", apoi grupează dupămaterialtype.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)