CommencerCommencez gratuitement

Synthétiser des données Parquet

Le premier rapport basé sur Parquet est le récapitulatif des paiements numériques que l'équipe a construit au chapitre 1, mais en partant cette fois d'une requête scan_parquet. Reproduisez le même pipeline lazy afin que l'équipe puisse réutiliser ce modèle dans tout son archive.

Le LazyFrame requests est déjà prêt pour vous à partir du fichier Parquet.

Cet exercice fait partie du cours

<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>
Voir le cours

Instructions de l’exercice

  • Filtrez requests aux lignes où use vaut "Digital".
  • Regroupez les lignes filtrées par format.
  • Déclenchez l'exécution tout à la fin du pipeline.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
Modifier et exécuter le code