開始使用免費開始

衡量詞向量的相似度

在這個課程中,你會用實際訓練出的詞向量來了解詞向量的威力。這些詞向量來自 Stanford NLP group 公布的詞向量清單。詞向量是一串數值所組成的序列或向量。例如: dog = (0.31, 0.92, 0.13)

詞向量之間的距離可以用成對的相似度量來衡量。這裡我們會使用 sklearn.metrics.pairwise.cosine_similarity。當兩個向量在對應元素上的相似程度越高時,餘弦相似度會產生越大的數值,反之則越小。

本練習屬於課程

使用 Keras 進行機器翻譯

檢視課程

練習說明

  • 使用 ndarray.size 屬性印出 cat_vector 的長度。
  • 使用 cosine_similarity 計算並印出 cat_vectorwindow_vector 的相似度。
  • 使用 cosine_similarity 計算並印出 cat_vectordog_vector 的相似度。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from sklearn.metrics.pairwise import cosine_similarity

# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)

# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)

# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))
編輯並執行程式碼