开始使用免费开始使用

扫描 Hive 分区数据集

团队还将清洗后的 Parquet 借阅记录按 Hive 分区布局存储,每个年份一个目录(checkoutyear=2023/checkoutyear=2024/)。请扫描这个分区数据集,并在分区列上进行过滤,让 Polars 只读取您真正需要的年份。

polars 已作为 pl 加载,根目录保存在 HIVE_DIR 中。分区目录已经为您打印出来,便于查看目录结构。

本练习是课程的一部分

使用 Polars 扩展与优化数据流水线

查看课程

练习说明

  • 使用正确的参数在扫描 HIVE_DIR 时启用 Hive 分区。
  • 将结果过滤为 2024 年及之后的借阅记录。

交互式实操练习

通过完成这段示例代码来试试这个练习。

requests = pl.scan_parquet(
    HIVE_DIR,
    # Enable hive partitioning
    ____=True,
)

result = (
    requests
    # Filter to the 2024 partition
    .filter(pl.col("checkoutyear") >= ____)
    .group_by("format")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
编辑并运行代码