始める無料で始める

コーパスのコサイン類似度行列

この演習では、5つの文を含むリストである corpus が与えられています。corpus はコンソールに表示されています。tf-idf でベクトル化した各文の組み合わせについて、コサイン類似度スコアを格納するコサイン類似度行列を計算してください。

類似度行列の i 行目・j 列目の値は、i 番目と j 番目のベクトルの類似度スコアを表すことを思い出してください。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • TfidfVectorizer のインスタンスを初期化し、tfidf_vectorizer という名前を付けます。
  • fit_transform() を使って corpus の tf-idf ベクトルを生成し、tfidf_matrix と名付けます。
  • cosine_similarity()tfidf_matrix を渡して、コサイン類似度行列 cosine_sim を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
コードを編集して実行