使用 TF-IDF 比较所有电影
现在,您已经将 TF-IDF 数据整理成可用格式,是时候用它来计算相似度并生成推荐了。
这一次由于使用的是 TF-IDF 分数(浮点数,而非布尔值),您将使用余弦相似度来衡量条目之间的相似性。 在本练习中,您将生成一个包含所有电影两两余弦相似度的矩阵,并将其存入一个 DataFrame,方便查找。这将使您可以快速、轻松地比较电影并找到推荐。
上一练习中您创建的 tfidf_df DataFrame 已为您加载,每部电影对应一行。
本练习是课程的一部分
用 Python 构建推荐引擎
练习说明
- 计算所有电影之间的余弦相似度,并将结果赋给
cosine_similarity_array。 - 使用
cosine_similarity_array创建一个 DataFrame,行索引和列索引均设为tfidf_summary_df.index。 - 打印该 DataFrame 的前 5 行,并查看相似度分数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____
# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)
# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)
# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())