Začněte nyníZačněte zdarma

Uložení vyčištěného extraktu do Parquetu

Zpátky k datům ze seattleské knihovny. Tým má vyčištěný extrakt výpůjček, který chce zapsat do Parquetu pro navazující nástroje – ale nechce nejdřív načíst celá data do paměti. Zapiš lazy dotaz přímo na disk.

clean_checkouts je předem načtený, stejně jako exportní cesta CLEAN_EXPORT_PATH.

Toto cvičení je součástí kurzu

Scaling and Optimizing Data Pipelines with Polars

Zobrazit kurz

Pokyny k cvičení

  • Zapiš clean_checkouts do CLEAN_EXPORT_PATH přímo z lazy dotazu.
  • Nastav velikost skupiny řádků na 5 000.
  • Použij streamovací engine.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Write clean_checkouts straight to disk
clean_checkouts.____(
    CLEAN_EXPORT_PATH,
    # 5,000 rows per row group
    row_group_size=____,
    # Streaming engine
    engine="____",
)

# Confirm what landed in the Parquet file
result = pl.scan_parquet(CLEAN_EXPORT_PATH).select(
    pl.len().alias("rows"),
    pl.col("checkouts").sum().alias("total_checkouts"),
).collect()
print(result)
Upravit a spustit kód