Categorical 列の作成
ストリーミングスタートアップの映画データセットに戻りましょう。original_language 列のほとんどの行には、同じわずかなコード(en、fr、es など)が繰り返し使われています。Categorical 型にキャストすると、各ユニークなラベルが内部で整数としてエンコードされ、繰り返し文字列のメモリ使用量を削減できます。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
original_language列をpl.Categoricalにキャストしてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
movies_cat = movies.with_columns(
# Cast to Categorical to save memory
pl.col("original_language").____(pl.____)
)
result = movies_cat.select("movie_title", "original_language").head(8)
print(result)