CommencerCommencez gratuitement

Analyse de plusieurs fichiers

Les données de prêts de l'équipe sont désormais réparties dans un CSV par année (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Ces fichiers annuels utilisent les anciens noms de colonnes usageclass et materialtype. Utilisez un motif glob pour analyser tous les fichiers ensemble comme un seul jeu de données logique, puis construisez un récapitulatif des prêts physiques.

polars est importé sous pl, et le répertoire se trouve dans MULTIFILE_DIR.

Cet exercice fait partie du cours

<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>
Voir le cours

Instructions de l’exercice

  • Analysez chaque fichier seattle_*.csv dans MULTIFILE_DIR à l'aide d'un motif glob.
  • Filtrez l'ensemble combiné sur les prêts "Physical", puis regroupez par materialtype.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Modifier et exécuter le code