Écrire un instantané Parquet
Un tableau de bord en aval a besoin d'un instantané Parquet allégé de l'activité des ebooks numériques. Construisez le résultat en mode paresseux, puis réécrivez-le avec des paramètres explicites de compression et de groupe de lignes pour optimiser le fichier pour des lectures rapides.
Le LazyFrame requests est disponible, et le chemin d'export est dans PARQUET_EXPORT_PATH.
Cet exercice fait partie du cours
<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>Instructions de l’exercice
- Ne conserver que les 500 premières lignes numériques pour l'instantané.
- Définir
compression_levelà5lors de l'écriture du fichier Parquet. - Définir
row_group_sizeà250lignes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
result = (
requests
.filter(pl.col("use") == "Digital")
.select("date", "format", "checkouts", "title")
# Keep only the first 500 rows
.____(500)
.collect()
)
result.write_parquet(
PARQUET_EXPORT_PATH,
# Set compression level to 5
compression_level=____,
# Set 250 rows per row group
row_group_size=____,
)
print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))