CommencezCommencez gratuitement

Balayer un jeu de données partitionné de type Hive

L'équipe entrepose aussi des fichiers Parquet de prêts nettoyés dans une organisation partitionnée de type Hive, avec un répertoire par année (checkoutyear=2023/, checkoutyear=2024/). Balayez le jeu de données partitionné et filtrez sur la colonne de partition pour que Polars ne lise que les années réellement nécessaires.

polars est chargé sous pl, et le répertoire racine est dans HIVE_DIR. Les répertoires de partition sont affichés pour vous permettre de voir la structure.

Cette activité fait partie du cours

Mise à l'échelle et optimisation des pipelines de données avec Polars

Voir le cours

Instructions de l’exercice

  • Balayez HIVE_DIR en utilisant l'argument approprié pour activer la partition de type Hive.
  • Filtrez le résultat pour ne conserver que les prêts de 2024 et plus récents.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Modifier et exécuter le code