ÎncepețiÎncepe gratuit

Scrierea unui snapshot Parquet

Un dashboard din aval are nevoie de un snapshot Parquet mai compact al activității cu cărți electronice. Construiește rezultatul în mod lazy, apoi scrie-l înapoi cu setări explicite de compresie și dimensiune a grupului de rânduri, pentru a optimiza fișierul în vederea unor citiri rapide.

LazyFrame-ul requests este disponibil, iar calea de export se află în PARQUET_EXPORT_PATH.

Acest exercițiu face parte din cursul

Scalarea și optimizarea pipeline-urilor de date cu Polars

Vezi cursul

Instrucțiuni pentru exercițiu

  • Păstrează doar primele 500 de rânduri digitale pentru snapshot.
  • Setează compression_level la 5 când scrii fișierul Parquet.
  • Setează row_group_size la 250 de rânduri.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

result = (
    requests
    .filter(pl.col("use") == "Digital")
    .select("date", "format", "checkouts", "title")
    # Keep only the first 500 rows
    .____(500)
    .collect()
)

result.write_parquet(
    PARQUET_EXPORT_PATH,
    # Set compression level to 5
    compression_level=____,
    # Set 250 rows per row group
    row_group_size=____,
)

print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))
Editează și rulează codul