ÎncepețiÎncepe gratuit

Scanarea mai multor fișiere

Datele de împrumut ale echipei sunt acum împărțite într-un fișier CSV pe an (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Aceste fișiere anuale folosesc denumirile vechi de coloane usageclass și materialtype. Folosește un șablon glob pentru a scana toate fișierele împreună ca un singur set de date logic, apoi construiește un rezumat al împrumuturilor fizice.

polars este importat ca pl, iar directorul se află în MULTIFILE_DIR.

Acest exercițiu face parte din cursul

Scalarea și optimizarea pipeline-urilor de date cu Polars

Vezi cursul

Instrucțiuni pentru exercițiu

  • Scanează toate fișierele seattle_*.csv din MULTIFILE_DIR folosind un șablon glob.
  • Filtrează setul de date combinat pentru împrumuturile de tip "Physical", apoi grupează după materialtype.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Editează și rulează codul