语料库的余弦相似度矩阵
本练习提供了一个 corpus,其中包含 5 个句子的列表。corpus 已在控制台打印。您需要计算余弦相似度矩阵,其中包含每一对句子的成对余弦相似度分数(使用 tf-idf 向量化)。
请记住,相似度矩阵中第 i 行第 j 列的值表示第 i 个与第 j 个向量的相似度分数。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 初始化一个
TfidfVectorizer实例,命名为tfidf_vectorizer。 - 使用
fit_transform()为corpus生成 tf-idf 向量,命名为tfidf_matrix。 - 使用
cosine_similarity()并传入tfidf_matrix,计算余弦相似度矩阵cosine_sim。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)