Filtrage rapide sur des données triées
L'équipe d'analyse historique a besoin de tous les enregistrements d'emprunt antérieurs à 2021. Le fichier CSV est déjà trié par date, donc si vous l'indiquez à Polars, il peut arrêter la lecture dès que la première ligne de 2021 apparaît.
Cette activité fait partie du cours
Mise à l'échelle et optimisation des pipelines de données avec Polars
Instructions de l’exercice
- Indiquez que la colonne
dateest triée pour que Polars puisse utiliser une lecture rapide. - Filtrez les lignes où
dateest antérieure au 1er janvier 2021. - Exécutez la requête paresseuse.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
result = (
library
# Mark date as sorted to enable the fast-path scan
.____("date")
# Filter to rows before 2021-01-01
.filter(pl.col("date") < pl.____(2021, 1, 1))
# Execute the lazy query
.____()
)
print(result.head())