Analyse de plusieurs fichiers
Les données de prêts de l'équipe sont désormais réparties dans un CSV par année (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Ces fichiers annuels utilisent les anciens noms de colonnes usageclass et materialtype. Utilisez un motif glob pour analyser tous les fichiers ensemble comme un seul jeu de données logique, puis construisez un récapitulatif des prêts physiques.
polars est importé sous pl, et le répertoire se trouve dans MULTIFILE_DIR.
Cet exercice fait partie du cours
<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>Instructions de l’exercice
- Analysez chaque fichier
seattle_*.csvdansMULTIFILE_DIRà l'aide d'un motif glob. - Filtrez l'ensemble combiné sur les prêts
"Physical", puis regroupez parmaterialtype.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)