Meerdere bestanden scannen
De checkoutdata van het team is nu opgesplitst in één CSV per jaar (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Deze jaarbestanden gebruiken de oude kolomnamen usageclass en materialtype. Gebruik een glob‑patroon om alle bestanden samen als één logische gegevensset te scannen en bouw daarna een samenvatting van fysieke checkouts.
polars is geladen als pl, en de map staat in MULTIFILE_DIR.
Deze oefening maakt deel uit van de cursus
Data-pipelines schalen en optimaliseren met Polars
Oefeninstructies
- Scan elk
seattle_*.csv‑bestand inMULTIFILE_DIRmet een glob‑patroon. - Filter de gecombineerde gegevensset naar
"Physical"checkouts en groepeer daarna opmaterialtype.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)