映画プロットのTF-IDF
ランダムに選ばれた映画のプロットを使って、ドキュメントのクラスタリングを行いましょう。ドキュメントをクラスタリングする前に、不要なノイズ(特殊文字やストップワードなど)を取り除き、TF-IDF によって疎行列に変換する必要があります。
リスト plots に保存された映画プロットに対して TF-IDF を行うために、TfidfVectorizer クラスを使用してください。TfidfVectorizer クラスでは tokenizer として remove_noise() 関数が利用できます。.fit_transform() メソッドは、データを TfidfVectorizer オブジェクトに適合させ、その後 TF-IDF の疎行列を生成します。
注意: .fit_transform() メソッドの実行には数秒かかります。
この演習はコースの一部です
Pythonで学ぶクラスタ分析
演習の手順
sklearnからTfidfVectorizerクラスをインポートします。- 最小頻度 0.1、最大頻度 0.75、最大特徴量数 50 で
TfidfVectorizerクラスを初期化します。 - 初期化した
TfidfVectorizerクラスに対して、リスト plots を使ってfit_transform()メソッドを実行します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____