Ein bereinigtes Extract nach Parquet schreiben
Zurück zu den Daten der Bibliothek in Seattle. Das Team hat ein bereinigtes Checkout-Extract, das für nachgelagerte Tools nach Parquet geschrieben werden soll, ohne zuvor alles im Speicher zu materialisieren. Schreib die Lazy-Query direkt auf die Festplatte.
clean_checkouts ist bereits geladen, ebenso der Exportpfad CLEAN_EXPORT_PATH.
Diese Übung ist Teil des Kurses
<Kurs>Skalieren und Optimieren von Data-Pipelines mit Polars</Kurs>Übungsanweisungen
- Schreib
clean_checkoutsdirekt aus der Lazy-Query nachCLEAN_EXPORT_PATH. - Setze die Row-Group-Größe auf 5.000.
- Verwende die Streaming-Engine.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)