扫描多个文件
团队的借阅数据现在按年份拆分为多个 CSV(seattle_2021.csv、seattle_2022.csv、seattle_2023.csv)。这些年度文件使用旧版列名 usageclass 和 materialtype。请使用通配符模式将所有文件作为一个逻辑数据集进行扫描,然后构建实体馆藏借阅汇总。
polars 已以 pl 加载,目录路径在 MULTIFILE_DIR。
本练习是课程的一部分
使用 Polars 扩展与优化数据流水线
练习说明
- 使用通配符模式,在
MULTIFILE_DIR中扫描每个seattle_*.csv文件。 - 将合并后的数据集筛选为
"Physical"借阅,然后按materialtype分组。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)