CommencerCommencez gratuitement

Écrire un extrait nettoyé dans Parquet

Retour aux données de la bibliothèque de Seattle. L'équipe dispose d'un extrait de prêts nettoyé qu'elle souhaite écrire en Parquet pour des outils en aval, sans matérialiser l'ensemble en mémoire au préalable. Écrivez la requête paresseuse directement sur le disque.

clean_checkouts est préchargé, ainsi que le chemin d'export CLEAN_EXPORT_PATH.

Cet exercice fait partie du cours

<cours>Mise à l'échelle et optimisation des pipelines de données avec Polars</cours>
Voir le cours

Instructions de l’exercice

  • Écrivez clean_checkouts vers CLEAN_EXPORT_PATH directement depuis la requête paresseuse.
  • Définissez la taille des groupes de lignes à 5 000.
  • Utilisez le moteur de streaming.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Write clean_checkouts straight to disk
clean_checkouts.____(
    CLEAN_EXPORT_PATH,
    # 5,000 rows per row group
    row_group_size=____,
    # Streaming engine
    engine="____",
)

# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
    pl.len().alias("rows"),
    pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)
Modifier et exécuter le code