コーパスのコサイン類似度行列
この演習では、5つの文を含むリストである corpus が与えられています。corpus はコンソールに表示されています。tf-idf でベクトル化した各文の組み合わせについて、コサイン類似度スコアを格納するコサイン類似度行列を計算してください。
類似度行列の i 行目・j 列目の値は、i 番目と j 番目のベクトルの類似度スコアを表すことを思い出してください。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
TfidfVectorizerのインスタンスを初期化し、tfidf_vectorizerという名前を付けます。fit_transform()を使ってcorpusの tf-idf ベクトルを生成し、tfidf_matrixと名付けます。cosine_similarity()にtfidf_matrixを渡して、コサイン類似度行列cosine_simを計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)