评分的数据类型
Markus 看了很多电影,包括纪录片、超级英雄片、经典片和剧情片。结合您之前的 Spark 经验,使用包含 Markus 在不同类型下观看次数的数据框 markus_ratings,思考这些属于隐式评分还是显式评分。使用 groupBy() 方法确定哪种类型的观看次数最高,这很可能会影响 ALS 为 Markus 生成的推荐。
本练习是课程的一部分
使用 PySpark 构建推荐引擎
练习说明
- 使用
groupBy()方法按"Genre"对markus_ratings数据框分组。 - 调用
.sum()方法,计算每个类型的总观看次数。 - 结尾务必加上
.show()方法以查看计数结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Group the data by "Genre"
markus_ratings.____("____").____().____()