Menyinkronkan ekstrak yang sudah dibersihkan ke Parquet
Kembali ke data perpustakaan Seattle. Tim memiliki ekstrak checkout yang sudah dibersihkan dan ingin menuliskannya ke Parquet untuk alat hilir, tetapi mereka tidak ingin mematerialkan seluruhnya di memori terlebih dahulu. Tulis kueri lazy langsung ke disk.
clean_checkouts sudah dimuat, beserta path ekspor CLEAN_EXPORT_PATH.
Latihan ini merupakan bagian dari kursus
Menskalakan dan Mengoptimalkan Pipeline Data dengan Polars
Instruksi latihan
- Tulis
clean_checkoutskeCLEAN_EXPORT_PATHlangsung dari kueri lazy. - Atur ukuran row group menjadi 5.000.
- Gunakan streaming engine.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Write clean_checkouts straight to disk
clean_checkouts.____(
CLEAN_EXPORT_PATH,
# 5,000 rows per row group
row_group_size=____,
# Streaming engine
engine="____",
)
# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
pl.len().alias("rows"),
pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)