CommencezCommencez gratuitement

Balayer plusieurs fichiers

Les données d'emprunts de l'équipe sont maintenant réparties dans un CSV par année (seattle_2021.csv, seattle_2022.csv, seattle_2023.csv). Ces fichiers annuels utilisent les anciens noms de colonnes usageclass et materialtype. Utilisez un motif glob pour balayer tous les fichiers ensemble comme un seul ensemble de données logique, puis produisez un sommaire des emprunts physiques.

polars est chargé sous pl, et le répertoire est dans MULTIFILE_DIR.

Cette activité fait partie du cours

Mise à l'échelle et optimisation des pipelines de données avec Polars

Voir le cours

Instructions de l’exercice

  • Balayez chaque fichier seattle_*.csv dans MULTIFILE_DIR à l'aide d'un motif glob.
  • Filtrez l'ensemble de données combiné pour les emprunts "Physical", puis regroupez par materialtype.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Modifier et exécuter le code