始める無料で始める

tf-idf の単語頻度配列

この演習では、サンプルの文書コレクションに対して tf-idf の単語頻度配列を作成します。これには sklearn の TfidfVectorizer を使用します。TfidfVectorizer は文書のリストを単語頻度配列に変換し、csr_matrix として出力します。ほかの sklearn オブジェクトと同様に、fit()transform() メソッドを持ちます。

ペットに関するサンプル文書のリスト documents が与えられています。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • sklearn.feature_extraction.text から TfidfVectorizer をインポートします。
  • tfidf という名前の TfidfVectorizer インスタンスを作成します。
  • tfidf.fit_transform() メソッドを documents に適用し、結果を csr_mat に代入します。これは csr_matrix 形式の単語頻度配列です。
  • .toarray() メソッドを呼び出して csr_mat を確認し、結果を出力します。これはすでに用意されています。
  • 配列の列は単語に対応します。.get_feature_names_out() メソッドを tfidf に対して呼び出し、結果を words に代入して単語の一覧を取得します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import TfidfVectorizer
from ____ import ____

# Create a TfidfVectorizer: tfidf
tfidf = ____ 

# Apply fit_transform to document: csr_mat
csr_mat = ____

# Print result of toarray() method
print(csr_mat.toarray())

# Get the words: words
words = ____

# Print words
print(words)
コードを編集して実行