始める無料で始める

主要ジャンルの抽出

あなたは動画ストリーミングのスタートアップ企業のデータチームに加わりました。映画のメタデータは Parquet ファイルに保存されており、多くの作品が複数のジャンルにまたがるため、各映画の genres は文字列のリストとして格納されています。各行のリストから最初のジャンルを取り出し、トップレベルの primary_genre 列として整理しましょう。

polarspl としてインポート済みで、DataFrame movies は Parquet ファイルから事前に読み込まれています。

この演習はコースの一部です

Polars によるデータパイプラインのスケーリングと最適化

コースを見る

演習の手順

  • リスト式を使って、各行の genres リストから最初の要素を抽出してください。
  • 新しい列に primary_genre という名前を付けてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

result = movies.select(
    "movie_title",
    "genres",
    # Get the first genre
    pl.col("genres").list.____(0).alias("____"),
).head(8)
print(result)
コードを編集して実行