CommencerCommencez gratuitement

Analyser un jeu de données partitionné au format Hive

L'équipe stocke également les Parquet « checkouts » nettoyés selon une organisation partitionnée de type Hive, avec un répertoire par année (checkoutyear=2023/, checkoutyear=2024/). Analysez le jeu de données partitionné et filtrez sur la colonne de partition afin que Polars ne lise que les années dont vous avez réellement besoin.

polars est importé sous le nom pl, et le répertoire racine est dans HIVE_DIR. Les répertoires de partition sont affichés pour vous permettre de visualiser la structure.

Cet exercice fait partie du cours

<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>
Voir le cours

Instructions de l’exercice

  • Analysez HIVE_DIR en utilisant l'argument approprié pour activer la partition Hive.
  • Filtrez le résultat pour ne garder que les « checkouts » à partir de 2024.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Modifier et exécuter le code