CommencezCommencez gratuitement

Exporter un extrait nettoyé vers Parquet

Retour aux données de la bibliothèque de Seattle. L'équipe dispose d'un extrait de prêts nettoyé qu'elle souhaite écrire en Parquet pour des outils en aval, sans matérialiser l'ensemble en mémoire au préalable. Écrivez la requête paresseuse directement sur le disque.

clean_checkouts est déjà chargé, tout comme le chemin d'exportation CLEAN_EXPORT_PATH.

Cette activité fait partie du cours

Mise à l'échelle et optimisation des pipelines de données avec Polars

Voir le cours

Instructions de l’exercice

  • Écrivez clean_checkouts vers CLEAN_EXPORT_PATH directement à partir de la requête paresseuse.
  • Réglez la taille du groupe de lignes à 5 000.
  • Utilisez le moteur en mode diffusion (streaming).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Write clean_checkouts straight to disk
clean_checkouts.____(
    CLEAN_EXPORT_PATH,
    # 5,000 rows per row group
    row_group_size=____,
    # Streaming engine
    engine="____",
)

# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
    pl.len().alias("rows"),
    pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)
Modifier et exécuter le code