Exporter un extrait nettoyé vers Parquet
Retour aux données de la bibliothèque de Seattle. L'équipe dispose d'un extrait de prêts nettoyé qu'elle souhaite écrire en Parquet pour des outils en aval, sans matérialiser l'ensemble en mémoire au préalable. Écrivez la requête paresseuse directement sur le disque.
clean_checkouts est déjà chargé, tout comme le chemin d'exportation CLEAN_EXPORT_PATH.
Cette activité fait partie du cours
Mise à l'échelle et optimisation des pipelines de données avec Polars
Instructions de l’exercice
- Écrivez
clean_checkoutsversCLEAN_EXPORT_PATHdirectement à partir de la requête paresseuse. - Réglez la taille du groupe de lignes à 5 000.
- Utilisez le moteur en mode diffusion (streaming).
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)