Parquet データの集計
最初の Parquet ベースのレポートは、第 1 章でチームが作成したデジタルチェックアウトの集計です。今回は scan_parquet クエリを起点として構築します。チームがアーカイブ全体でこのパターンを再利用できるよう、同じ遅延パイプラインを作成しましょう。
Parquet ファイルから構築された LazyFrame requests はすでに用意されています。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
requestsをuseが"Digital"の行に絞り込みましょう。- 絞り込んだ行を
formatでグループ化しましょう。 - パイプラインの最後に実行をトリガーしましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
result = (
requests
# Filter to digital
.filter(pl.col("use") == "____")
# Group by format
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
# Trigger execution at the end
.____()
)
print(result)