在 PySpark 中做聚合
现在,您可以自己动手做一些聚合了!
您将使用之前用过的薪资数据集。来看看您能创建哪些聚合吧!
工作区中已经提供名为 spark 的 SparkSession,以及 Spark DataFrame salaries_df。
本练习是课程的一部分
PySpark 入门
练习说明
- 找到一家位于美国、规模为 Small 的公司中的最低薪资——进行过滤时请直接引用列(
"salary_in_usd"),不要传入 SQL 字符串。 - 找到一家位于美国、规模为 Large(用
"L"表示)的公司中的最高薪资——进行过滤时请直接引用列("salary_in_usd"),不要传入 SQL 字符串。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()