衡量词向量的相似度
在本课中,您将使用真实训练得到的词向量来理解词向量的威力。这些词向量来自 Stanford NLP group 发布的词向量列表。词向量是由数值组成的序列或向量。例如,
dog = (0.31, 0.92, 0.13)
词向量之间的距离可以通过成对的相似度度量来衡量。这里我们将使用 sklearn.metrics.pairwise.cosine_similarity。当两个向量在逐元素层面更相似时,余弦相似度会给出更高的值,反之则更低。
本练习是课程的一部分
使用 Keras 的机器翻译
练习说明
- 使用
ndarray.size属性打印cat_vector的长度。 - 使用
cosine_similarity计算并打印cat_vector与window_vector的相似度。 - 使用
cosine_similarity计算并打印cat_vector与dog_vector的相似度。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.metrics.pairwise import cosine_similarity
# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)
# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)
# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))