数値列のダウンキャスト
値の範囲に問題がないことを確認できたので、数値列をより小さなデータ型に変換しましょう。整数列には Int32 を、浮動小数点列には Float32 を使います。集計統計においては、この精度で十分です。
movies DataFrame はあらかじめ読み込まれています。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
vote_countとbudgetをpl.Int32にキャストします。runtimeとvote_averageをpl.Float32にキャストします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
movies_optimized = movies.with_columns(
# Integer columns to Int32
pl.col("vote_count").cast(pl.____),
pl.col("budget").cast(pl.____),
# Float columns to Float32
pl.col("runtime").cast(pl.____),
pl.col("vote_average").cast(pl.____),
)
result = movies_optimized.select(
"movie_title", "budget", "runtime", "vote_average", "vote_count"
).head(8)
print(result)