Scrierea unui snapshot Parquet
Un dashboard din aval are nevoie de un snapshot Parquet mai compact al activității cu cărți electronice. Construiește rezultatul în mod lazy, apoi scrie-l înapoi cu setări explicite de compresie și dimensiune a grupului de rânduri, pentru a optimiza fișierul în vederea unor citiri rapide.
LazyFrame-ul requests este disponibil, iar calea de export se află în PARQUET_EXPORT_PATH.
Acest exercițiu face parte din cursul
Scalarea și optimizarea pipeline-urilor de date cu Polars
Instrucțiuni pentru exercițiu
- Păstrează doar primele 500 de rânduri digitale pentru snapshot.
- Setează
compression_levella5când scrii fișierul Parquet. - Setează
row_group_sizela250de rânduri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
result = (
requests
.filter(pl.col("use") == "Digital")
.select("date", "format", "checkouts", "title")
# Keep only the first 500 rows
.____(500)
.collect()
)
result.write_parquet(
PARQUET_EXPORT_PATH,
# Set compression level to 5
compression_level=____,
# Set 250 rows per row group
row_group_size=____,
)
print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))