Scansione di più file
I dati dei prestiti del team sono ora suddivisi in un CSV per anno (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Questi file annuali usano i nomi di colonna legacy usageclass e materialtype. Usa un pattern glob per scansionare tutti i file insieme come un unico insieme di dati logico, quindi crea un riepilogo dei prestiti fisici.
polars è caricato come pl e la directory è in MULTIFILE_DIR.
Questo esercizio fa parte del corso
Scalare e ottimizzare le pipeline di dati con Polars
Istruzioni dell'esercizio
- Scansiona ogni file
seattle_*.csvinMULTIFILE_DIRusando un pattern glob. - Filtra l'insieme di dati combinato ai prestiti
"Physical", poi raggruppa permaterialtype.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)