始める無料で始める

単語ベクトルの類似度を測る

このレッスンでは、実際に学習済みの単語ベクトルを使って、その威力を体感します。ここで使うのは、Stanford NLP group が公開している単語ベクトルの一覧から抽出したものです。単語ベクトルとは、数値の並び(ベクトル)です。たとえば、 dog = (0.31, 0.92, 0.13)

単語ベクトル間の距離は、ペアごとの類似度指標で測定できます。ここでは sklearn.metrics.pairwise.cosine_similarity を使用します。コサイン類似度は、2つのベクトルの要素ごとのパターンが似ているほど高い値を返し、似ていないほど低い値になります。

この演習はコースの一部です

Kerasで学ぶMachine Translation

コースを見る

演習の手順

  • ndarray.size 属性を使って、cat_vector の長さを出力してください。
  • cosine_similarity を使って、cat_vectorwindow_vector の類似度を計算して出力してください。
  • cosine_similarity を使って、cat_vectordog_vector の類似度を計算して出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from sklearn.metrics.pairwise import cosine_similarity

# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)

# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)

# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))
コードを編集して実行