始める無料で始める

TF-IDF のDataFrameを作成する

TF-IDF の特徴量を作成できたので、これをレコメンド作成に使える形式に整えましょう。 ここでも pandas を使い、配列を DataFrame に包みます。 データのフィルタリングに映画タイトルを使うため、DataFrame のインデックスにタイトルを設定します。

df_plots DataFrame はあらかじめ読み込まれています。Title 列に映画名、Plot 列にあらすじが入っています。

この演習はコースの一部です

Pythonでつくるレコメンデーションエンジン

コースを見る

演習の手順

  • TfidfVectorizer を作成し、前の演習と同様に fit および transform を行ってください。
  • 生成した vectorized_data を DataFrame で包みます。fit/transform フェーズで生成された特徴量名を列名として使用し、新しい DataFrame を tfidf_df に代入してください。
  • 作成した tfidf_df のインデックスに、元の映画タイトルを割り当ててください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot']) 

# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())

# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())
コードを編集して実行