欠損列の挿入
ある年の抽出ファイルには pub 列(出版社)が含まれていませんが、チームは両方のファイルを1つのデータセットとして読み込みたいと考えています。列が存在しない場合にエラーを発生させるのではなく、Polars が null を挿入するよう、適切な引数を指定しましょう。
polars は pl としてロード済みで、ディレクトリは DRIFT_DIR に格納されています。スキーマの違いを確認できるよう、各ファイルのヘッダーが表示されます。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
DRIFT_DIR内のすべてのseattle_*.csvファイルを対象に、グロブパターンを使ってスキャンしましょう。- 一部のファイルに存在しない列に対して null を挿入するよう、適切な引数を追加しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
str(DRIFT_DIR / "____"),
try_parse_dates=True,
# Insert missing columns instead of failing on schema differences
____="____",
)
result = combined.select("date", "format", "title", "pub").collect()
print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))