Object 型の作成
テキストのアドホック分析のため、各映画のタイトルを小文字の単語からなるPythonのセットとして取得したいと思います。セットはPolarsのネイティブ型ではないため、pl.Object 型の列に格納します。
DataFrame movies はすでに利用可能で、ヘルパー関数 title_to_word_set(title) も定義済みです。この関数はタイトルから小文字の単語のPythonセットを返します。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
- 各
movie_titleに対してtitle_to_word_setを実行し、返されたPythonセットを新しい列に格納してください。 - 新しい列に
title_word_setというエイリアスを付けてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
result = movies.with_columns(
pl.col("movie_title")
# Convert each title to a set of words
.____(title_to_word_set, return_dtype=pl.____)
.alias("____")
).select("movie_title", "title_word_set").head(8)
print(result)