始める無料で始める

Categorical 列の作成

ストリーミングスタートアップの映画データセットに戻りましょう。original_language 列のほとんどの行には、同じわずかなコード(enfres など)が繰り返し使われています。Categorical 型にキャストすると、各ユニークなラベルが内部で整数としてエンコードされ、繰り返し文字列のメモリ使用量を削減できます。

この演習はコースの一部です

Polars によるデータパイプラインのスケーリングと最適化

コースを見る

演習の手順

  • original_language 列を pl.Categorical にキャストしてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

movies_cat = movies.with_columns(
    # Cast to Categorical to save memory
    pl.col("original_language").____(pl.____)
)

result = movies_cat.select("movie_title", "original_language").head(8)
print(result)
コードを編集して実行