Złożone agregacje
Aby zapoznać cię z kolejnymi wbudowanymi metodami agregacji, wykonajmy nieco bardziej złożoną agregację! Celem jest połączenie wszystkich poleceń w jedną linię.
Pamiętaj, że sesja SparkSession o nazwie spark jest już dostępna w twoim środowisku pracy, a wraz z nią ramka danych Spark o nazwie salaries_df.
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Oblicz średnie wynagrodzenia w dużych firmach w USA, korzystając z kolumny
"salary_in_usd". - Oblicz łączną sumę wynagrodzeń w dużych firmach w USA.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____
#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")
# Total salaries in usd
large_companies.groupBy().____.show()