Inizia subitoInizia gratis

Scansione di più file

I dati dei prestiti del team sono ora suddivisi in un CSV per anno (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Questi file annuali usano i nomi di colonna legacy usageclass e materialtype. Usa un pattern glob per scansionare tutti i file insieme come un unico insieme di dati logico, quindi crea un riepilogo dei prestiti fisici.

polars è caricato come pl e la directory è in MULTIFILE_DIR.

Questo esercizio fa parte del corso

Scalare e ottimizzare le pipeline di dati con Polars

Visualizza corso

Istruzioni dell'esercizio

  • Scansiona ogni file seattle_*.csv in MULTIFILE_DIR usando un pattern glob.
  • Filtra l'insieme di dati combinato ai prestiti "Physical", poi raggruppa per materialtype.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Modifica ed esegui il codice