主要ジャンルの抽出
あなたは動画ストリーミングのスタートアップ企業のデータチームに加わりました。映画のメタデータは Parquet ファイルに保存されており、多くの作品が複数のジャンルにまたがるため、各映画の genres は文字列のリストとして格納されています。各行のリストから最初のジャンルを取り出し、トップレベルの primary_genre 列として整理しましょう。
polars は pl としてインポート済みで、DataFrame movies は Parquet ファイルから事前に読み込まれています。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
- リスト式を使って、各行の
genresリストから最初の要素を抽出してください。 - 新しい列に
primary_genreという名前を付けてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
result = movies.select(
"movie_title",
"genres",
# Get the first genre
pl.col("genres").list.____(0).alias("____"),
).head(8)
print(result)