始める無料で始める

Parquet データの集計

最初の Parquet ベースのレポートは、第 1 章でチームが作成したデジタルチェックアウトの集計です。今回は scan_parquet クエリを起点として構築します。チームがアーカイブ全体でこのパターンを再利用できるよう、同じ遅延パイプラインを作成しましょう。

Parquet ファイルから構築された LazyFrame requests はすでに用意されています。

この演習はコースの一部です

Polars によるデータパイプラインのスケーリングと最適化

コースを見る

演習の手順

  • requestsuse"Digital" の行に絞り込みましょう。
  • 絞り込んだ行を format でグループ化しましょう。
  • パイプラインの最後に実行をトリガーしましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

result = (
    requests
    # Filter to digital
    .filter(pl.col("use") == "____")
    # Group by format
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    # Trigger execution at the end
    .____()
)
print(result)
コードを編集して実行