Balayer un jeu de données partitionné de type Hive
L'équipe entrepose aussi des fichiers Parquet de prêts nettoyés dans une organisation partitionnée de type Hive, avec un répertoire par année (checkoutyear=2023/, checkoutyear=2024/). Balayez le jeu de données partitionné et filtrez sur la colonne de partition pour que Polars ne lise que les années réellement nécessaires.
polars est chargé sous pl, et le répertoire racine est dans HIVE_DIR. Les répertoires de partition sont affichés pour vous permettre de voir la structure.
Cette activité fait partie du cours
Mise à l'échelle et optimisation des pipelines de données avec Polars
Instructions de l’exercice
- Balayez
HIVE_DIRen utilisant l'argument approprié pour activer la partition de type Hive. - Filtrez le résultat pour ne conserver que les prêts de 2024 et plus récents.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)