开始使用免费开始使用

插入缺失列

某一年的抽取文件缺少 pub 列(publisher),但团队仍希望将两个文件作为同一数据集进行扫描。请选择正确的参数,让 Polars 在缺少某列时插入 null,而不是报错。

polars 已作为 pl 加载,目录在 DRIFT_DIR。每个文件的表头都会为您打印出来,便于查看模式差异。

本练习是课程的一部分

使用 Polars 扩展与优化数据流水线

查看课程

练习说明

  • 使用通配模式,在 DRIFT_DIR 中扫描每个 seattle_*.csv 文件。
  • 添加正确的参数,让 Polars 为某些文件中缺失的列插入 null。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
编辑并运行代码