Écrire un extrait nettoyé dans Parquet
Retour aux données de la bibliothèque de Seattle. L'équipe dispose d'un extrait de prêts nettoyé qu'elle souhaite écrire en Parquet pour des outils en aval, sans matérialiser l'ensemble en mémoire au préalable. Écrivez la requête paresseuse directement sur le disque.
clean_checkouts est préchargé, ainsi que le chemin d'export CLEAN_EXPORT_PATH.
Cet exercice fait partie du cours
<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>Instructions de l’exercice
- Écrivez
clean_checkoutsversCLEAN_EXPORT_PATHdirectement depuis la requête paresseuse. - Définissez la taille des groupes de lignes à 5 000.
- Utilisez le moteur de streaming.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)