Komplexa aggregationer
För att du ska bekanta dig med fler inbyggda aggregationsmetoder ska vi göra en lite mer komplex aggregation! Målet är att kombinera alla dessa kommandon till en enda rad.
Kom ihåg att en SparkSession med namnet spark redan finns tillgänglig i din miljö, tillsammans med Spark DataFrame:en salaries_df.
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Beräkna genomsnittslönerna för stora amerikanska företag med hjälp av kolumnen
"salary_in_usd". - Beräkna den totala lönesumman för stora amerikanska företag.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____
#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")
# Total salaries in usd
large_companies.groupBy().____.show()