扫描 Hive 分区数据集
团队还将清洗后的 Parquet 借阅记录按 Hive 分区布局存储,每个年份一个目录(checkoutyear=2023/、checkoutyear=2024/)。请扫描这个分区数据集,并在分区列上进行过滤,让 Polars 只读取您真正需要的年份。
polars 已作为 pl 加载,根目录保存在 HIVE_DIR 中。分区目录已经为您打印出来,便于查看目录结构。
本练习是课程的一部分
使用 Polars 扩展与优化数据流水线
练习说明
- 使用正确的参数在扫描
HIVE_DIR时启用 Hive 分区。 - 将结果过滤为 2024 年及之后的借阅记录。
交互式实操练习
通过完成这段示例代码来试试这个练习。
requests = pl.scan_parquet(
HIVE_DIR,
# Enable hive partitioning
____=True,
)
result = (
requests
# Filter to the 2024 partition
.filter(pl.col("checkoutyear") >= ____)
.group_by("format")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)