开始使用免费开始使用

语料库的余弦相似度矩阵

本练习提供了一个 corpus,其中包含 5 个句子的列表。corpus 已在控制台打印。您需要计算余弦相似度矩阵,其中包含每一对句子的成对余弦相似度分数(使用 tf-idf 向量化)。

请记住,相似度矩阵中第 i 行第 j 列的值表示第 i 个与第 j 个向量的相似度分数。

本练习是课程的一部分

Python 中的 NLP 特征工程

查看课程

练习说明

  • 初始化一个 TfidfVectorizer 实例,命名为 tfidf_vectorizer
  • 使用 fit_transform()corpus 生成 tf-idf 向量,命名为 tfidf_matrix
  • 使用 cosine_similarity() 并传入 tfidf_matrix,计算余弦相似度矩阵 cosine_sim

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
编辑并运行代码