始める無料で始める

複数ファイルのスキャン

チームのチェックアウトデータは、年ごとに1つのCSVファイル(seattle_2021.csvseattle_2022.csvseattle_2023.csv)に分割されています。これらの年次ファイルでは、usageclassmaterialtype というレガシー列名が使用されています。グロブパターンを使ってすべてのファイルを1つの論理的なデータセットとしてスキャンし、物理的なチェックアウトのサマリーを作成しましょう。

polarspl としてロードされており、ディレクトリは MULTIFILE_DIR に格納されています。

この演習はコースの一部です

Polars によるデータパイプラインのスケーリングと最適化

コースを見る

演習の手順

  • グロブパターンを使って、MULTIFILE_DIR 内のすべての seattle_*.csv ファイルをスキャンします。
  • 結合したデータセットを "Physical" チェックアウトに絞り込み、materialtype でグループ化します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
コードを編集して実行