Складні агрегації
Щоб ви познайомилися з більшою кількістю вбудованих методів агрегування, виконаймо трохи складнішу агрегацію! Мета — об'єднати всі ці команди в один рядок.
Пам'ятайте, що SparkSession з назвою spark уже є у вашому робочому середовищі, так само як і датафрейм Spark salaries_df.
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Обчисліть середню зарплату у великих компаніях США, використовуючи стовпець
"salary_in_usd". - Обчисліть загальну суму зарплат у великих компаніях США.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____
#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")
# Total salaries in usd
large_companies.groupBy().____.show()