开始使用免费开始使用

衡量词向量的相似度

在本课中,您将使用真实训练得到的词向量来理解词向量的威力。这些词向量来自 Stanford NLP group 发布的词向量列表。词向量是由数值组成的序列或向量。例如, dog = (0.31, 0.92, 0.13)

词向量之间的距离可以通过成对的相似度度量来衡量。这里我们将使用 sklearn.metrics.pairwise.cosine_similarity。当两个向量在逐元素层面更相似时,余弦相似度会给出更高的值,反之则更低。

本练习是课程的一部分

使用 Keras 的机器翻译

查看课程

练习说明

  • 使用 ndarray.size 属性打印 cat_vector 的长度。
  • 使用 cosine_similarity 计算并打印 cat_vectorwindow_vector 的相似度。
  • 使用 cosine_similarity 计算并打印 cat_vectordog_vector 的相似度。

交互式实操练习

通过完成这段示例代码来试试这个练习。

from sklearn.metrics.pairwise import cosine_similarity

# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)

# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)

# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))
编辑并运行代码