插入缺失列
某一年的抽取文件缺少 pub 列(publisher),但团队仍希望将两个文件作为同一数据集进行扫描。请选择正确的参数,让 Polars 在缺少某列时插入 null,而不是报错。
polars 已作为 pl 加载,目录在 DRIFT_DIR。每个文件的表头都会为您打印出来,便于查看模式差异。
本练习是课程的一部分
使用 Polars 扩展与优化数据流水线
练习说明
- 使用通配模式,在
DRIFT_DIR中扫描每个seattle_*.csv文件。 - 添加正确的参数,让 Polars 为某些文件中缺失的列插入 null。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))