写入一个 Parquet 快照
下游的仪表盘需要一份更精简的电子书活动 Parquet 快照。请以惰性方式构建结果,然后在写回时显式设置压缩和行组参数,以便调优为快速读取。
已提供 LazyFrame requests,导出路径在 PARQUET_EXPORT_PATH。
本练习是课程的一部分
使用 Polars 扩展与优化数据流水线
练习说明
- 快照中仅保留前 500 行数字渠道的数据。
- 写入 Parquet 文件时,将
compression_level设为5。 - 将
row_group_size设为250行。
交互式实操练习
通过完成这段示例代码来试试这个练习。
result = (
requests
.filter(pl.col("use") == "Digital")
.select("date", "format", "checkouts", "title")
# Keep only the first 500 rows
.____(500)
.collect()
)
result.write_parquet(
PARQUET_EXPORT_PATH,
# Set compression level to 5
compression_level=____,
# Set 250 rows per row group
row_group_size=____,
)
print(pl.read_parquet_schema(PARQUET_EXPORT_PATH))