矩阵稀疏度
真实世界的评分数据常见问题是:大多数用户不会给大多数物品打分,而大多数物品也只会被少量用户评分。由此得到的 DataFrame 往往非常空,具有很高的稀疏性。
在本练习中,您将通过统计已填充(非空)的单元格数量,并与完整 DataFrame 的大小进行比较,来计算 movie_lens 评分数据的稀疏程度。
先前练习中使用的 DataFrame user_ratings_df 已为您加载。它按用户为行、电影为列。
本练习是课程的一部分
用 Python 构建推荐引擎
练习说明
- 统计
user_ratings_df中非空单元格的数量,并将结果存为sparsity_count。 - 统计
user_ratings_df的单元格总数,并将结果存为full_count。 - 用非空单元格数除以单元格总数,计算该 DataFrame 的稀疏度,并打印结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Count the occupied cells
sparsity_count = user_ratings_df.____().____.____()
# Count all cells
full_count = user_ratings_df.____
# Find the sparsity of the DataFrame
sparsity = ____ / ____
print(sparsity)