衡量詞向量的相似度
在這個課程中,你會用實際訓練出的詞向量來了解詞向量的威力。這些詞向量來自 Stanford NLP group 公布的詞向量清單。詞向量是一串數值所組成的序列或向量。例如:
dog = (0.31, 0.92, 0.13)
詞向量之間的距離可以用成對的相似度量來衡量。這裡我們會使用 sklearn.metrics.pairwise.cosine_similarity。當兩個向量在對應元素上的相似程度越高時,餘弦相似度會產生越大的數值,反之則越小。
本練習屬於課程
使用 Keras 進行機器翻譯
練習說明
- 使用
ndarray.size屬性印出cat_vector的長度。 - 使用
cosine_similarity計算並印出cat_vector與window_vector的相似度。 - 使用
cosine_similarity計算並印出cat_vector與dog_vector的相似度。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from sklearn.metrics.pairwise import cosine_similarity
# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)
# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)
# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))