开始使用免费开始使用

使用 TF-IDF 比较所有电影

现在,您已经将 TF-IDF 数据整理成可用格式,是时候用它来计算相似度并生成推荐了。

这一次由于使用的是 TF-IDF 分数(浮点数,而非布尔值),您将使用余弦相似度来衡量条目之间的相似性。 在本练习中,您将生成一个包含所有电影两两余弦相似度的矩阵,并将其存入一个 DataFrame,方便查找。这将使您可以快速、轻松地比较电影并找到推荐。

上一练习中您创建的 tfidf_df DataFrame 已为您加载,每部电影对应一行。

本练习是课程的一部分

用 Python 构建推荐引擎

查看课程

练习说明

  • 计算所有电影之间的余弦相似度,并将结果赋给 cosine_similarity_array
  • 使用 cosine_similarity_array 创建一个 DataFrame,行索引和列索引均设为 tfidf_summary_df.index
  • 打印该 DataFrame 的前 5 行,并查看相似度分数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____

# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)

# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)

# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())
编辑并运行代码