GroupBy 与 Filter 方法
现在我们对数据集有了更多了解,来查看 ratings 数据集的一些通用汇总指标,看看电影各自有多少评分,以及每位用户提供了多少评分。
在 Spark 中汇总统计时有两个常用方法对您很有帮助,分别是 .filter() 和 .groupBy()。.filter() 方法可用于过滤掉不满足条件的数据。
本练习是课程的一部分
使用 PySpark 构建推荐引擎
练习说明
- 从
pyspark.sql.functions导入col,并使用.show()查看ratings数据集。 - 在
ratings数据集上应用.filter()方法,在括号中加入以下筛选条件,仅包含小于 100 的userId:col("userId") < 100。 - 对
ratings数据集调用.groupBy()方法按userId分组。再调用.count()方法,查看每个userId评价了多少部电影。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()