开始使用免费开始使用

在 PySpark 中做聚合

现在,您可以自己动手做一些聚合了! 您将使用之前用过的薪资数据集。来看看您能创建哪些聚合吧! 工作区中已经提供名为 spark 的 SparkSession,以及 Spark DataFrame salaries_df

本练习是课程的一部分

PySpark 入门

查看课程

练习说明

  • 找到一家位于美国、规模为 Small 的公司中的最低薪资——进行过滤时请直接引用列("salary_in_usd"),不要传入 SQL 字符串。
  • 找到一家位于美国、规模为 Large(用 "L" 表示)的公司中的最高薪资——进行过滤时请直接引用列("salary_in_usd"),不要传入 SQL 字符串。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
编辑并运行代码