TF-IDF モデルを初期化する
デフォルトの TF-IDF は、すべてのドキュメント(ここでは映画のあらすじ)に登場するあらゆる単語に対して列を生成します。 この方法だと、どのドキュメントにも現れるごく一般的な単語と、ほとんど現れずアイテム間の類似性の判定に役立たない単語が両方含まれるため、非常に大きく直感的でないデータセットができてしまいます。
この演習では、df_plots という DataFrame を使います。Title 列に映画名、Plot 列にあらすじが入っています。
この DataFrame を用いて、まずはデフォルトの TF-IDF スコアを生成し、価値の低い列が含まれているかを確認します。
その後、min_df と max_df 引数を使って列数を制限し、TF-IDF の計算を再実行して、改善が見られるかを確かめます。
この演習はコースの一部です
Pythonでつくるレコメンデーションエンジン
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()
# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])
# Look at the features generated
print(____.____())