単語ベクトルの類似度を測る
このレッスンでは、実際に学習済みの単語ベクトルを使って、その威力を体感します。ここで使うのは、Stanford NLP group が公開している単語ベクトルの一覧から抽出したものです。単語ベクトルとは、数値の並び(ベクトル)です。たとえば、
dog = (0.31, 0.92, 0.13)
単語ベクトル間の距離は、ペアごとの類似度指標で測定できます。ここでは sklearn.metrics.pairwise.cosine_similarity を使用します。コサイン類似度は、2つのベクトルの要素ごとのパターンが似ているほど高い値を返し、似ていないほど低い値になります。
この演習はコースの一部です
Kerasで学ぶMachine Translation
演習の手順
ndarray.size属性を使って、cat_vectorの長さを出力してください。cosine_similarityを使って、cat_vectorとwindow_vectorの類似度を計算して出力してください。cosine_similarityを使って、cat_vectorとdog_vectorの類似度を計算して出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.metrics.pairwise import cosine_similarity
# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)
# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)
# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))