Balayer plusieurs fichiers
Les données d'emprunts de l'équipe sont maintenant réparties dans un CSV par année (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Ces fichiers annuels utilisent les anciens noms de colonnes usageclass et materialtype. Utilisez un motif glob pour balayer tous les fichiers ensemble comme un seul ensemble de données logique, puis produisez un sommaire des emprunts physiques.
polars est chargé sous pl, et le répertoire est dans MULTIFILE_DIR.
Cette activité fait partie du cours
Mise à l'échelle et optimisation des pipelines de données avec Polars
Instructions de l’exercice
- Balayez chaque fichier
seattle_*.csvdansMULTIFILE_DIRà l'aide d'un motif glob. - Filtrez l'ensemble de données combiné pour les emprunts
"Physical", puis regroupez parmaterialtype.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)