在 PySpark 進行彙總運算
現在你可以自己動手做一些彙總運算了!
你將使用之前用過的薪資資料集。來看看你能建立哪些彙總吧!
你的工作空間中已經有一個名為 spark 的 SparkSession,以及 Spark DataFrame salaries_df。
本練習屬於課程
PySpark 入門
練習說明
- 找出美國地區、Small 規模公司的最低薪資——請直接以欄位參照方式過濾(使用
"salary_in_usd"),不要傳入 SQL 字串。 - 找出美國地區、Large 規模(以
"L"表示)公司的最高薪資——請直接以欄位參照方式過濾(使用"salary_in_usd"),不要傳入 SQL 字串。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()