始める無料で始める

欠損列の挿入

ある年の抽出ファイルには pub 列(出版社)が含まれていませんが、チームは両方のファイルを1つのデータセットとして読み込みたいと考えています。列が存在しない場合にエラーを発生させるのではなく、Polars が null を挿入するよう、適切な引数を指定しましょう。

polarspl としてロード済みで、ディレクトリは DRIFT_DIR に格納されています。スキーマの違いを確認できるよう、各ファイルのヘッダーが表示されます。

この演習はコースの一部です

Polars によるデータパイプラインのスケーリングと最適化

コースを見る

演習の手順

  • DRIFT_DIR 内のすべての seattle_*.csv ファイルを対象に、グロブパターンを使ってスキャンしましょう。
  • 一部のファイルに存在しない列に対して null を挿入するよう、適切な引数を追加しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Scan both yearly files as one combined dataset
combined = pl.scan_csv(
    str(DRIFT_DIR / "____"),
    try_parse_dates=True,
    # Insert missing columns instead of failing on schema differences
    ____="____",
)

result = combined.select("date", "format", "title", "pub").collect()

print("First rows (from 2023 file):")
print(result.head(3))
print("\nLast rows (from 2024 file):")
print(result.tail(3))
コードを編集して実行