TF-IDF のDataFrameを作成する
TF-IDF の特徴量を作成できたので、これをレコメンド作成に使える形式に整えましょう。
ここでも pandas を使い、配列を DataFrame に包みます。
データのフィルタリングに映画タイトルを使うため、DataFrame のインデックスにタイトルを設定します。
df_plots DataFrame はあらかじめ読み込まれています。Title 列に映画名、Plot 列にあらすじが入っています。
この演習はコースの一部です
Pythonでつくるレコメンデーションエンジン
演習の手順
TfidfVectorizerを作成し、前の演習と同様に fit および transform を行ってください。- 生成した
vectorized_dataを DataFrame で包みます。fit/transform フェーズで生成された特徴量名を列名として使用し、新しい DataFrame をtfidf_dfに代入してください。 - 作成した
tfidf_dfのインデックスに、元の映画タイトルを割り当ててください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())