tf-idf の単語頻度配列
この演習では、サンプルの文書コレクションに対して tf-idf の単語頻度配列を作成します。これには sklearn の TfidfVectorizer を使用します。TfidfVectorizer は文書のリストを単語頻度配列に変換し、csr_matrix として出力します。ほかの sklearn オブジェクトと同様に、fit() と transform() メソッドを持ちます。
ペットに関するサンプル文書のリスト documents が与えられています。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
sklearn.feature_extraction.textからTfidfVectorizerをインポートします。tfidfという名前のTfidfVectorizerインスタンスを作成します。tfidfの.fit_transform()メソッドをdocumentsに適用し、結果をcsr_matに代入します。これは csr_matrix 形式の単語頻度配列です。.toarray()メソッドを呼び出してcsr_matを確認し、結果を出力します。これはすでに用意されています。- 配列の列は単語に対応します。
.get_feature_names_out()メソッドをtfidfに対して呼び出し、結果をwordsに代入して単語の一覧を取得します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)