开始使用免费开始使用

GroupBy 与 Filter 方法

现在我们对数据集有了更多了解,来查看 ratings 数据集的一些通用汇总指标,看看电影各自有多少评分,以及每位用户提供了多少评分。

在 Spark 中汇总统计时有两个常用方法对您很有帮助,分别是 .filter().groupBy().filter() 方法可用于过滤掉不满足条件的数据。

本练习是课程的一部分

使用 PySpark 构建推荐引擎

查看课程

练习说明

  • pyspark.sql.functions 导入 col,并使用 .show() 查看 ratings 数据集。
  • ratings 数据集上应用 .filter() 方法,在括号中加入以下筛选条件,仅包含小于 100 的 userIdcol("userId") < 100
  • ratings 数据集调用 .groupBy() 方法按 userId 分组。再调用 .count() 方法,查看每个 userId 评价了多少部电影。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
编辑并运行代码