复杂聚合
为让您熟悉更多内置聚合方法,我们来做一个稍微复杂一点的聚合!目标是把所有命令合并到一行中。
请记住,名为 spark 的 SparkSession 已在您的工作区中,同时还有 Spark DataFrame salaries_df。
本练习是课程的一部分
PySpark 入门
练习说明
- 使用
"salary_in_usd"列计算美国大型公司的平均薪资。 - 计算美国大型公司的薪资总额。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____
#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")
# Total salaries in usd
large_companies.groupBy().____.show()