Složitější agregace
Aby ses lépe seznámil/a s dalšími vestavěnými agregačními metodami, zkusíme trochu složitější agregaci! Cílem je sloučit všechny tyto příkazy do jediného řádku.
Pamatuj, že ve svém pracovním prostředí máš k dispozici SparkSession s názvem spark a Spark DataFrame salaries_df.
Toto cvičení je součástí kurzu
Introduction to PySpark
Pokyny k cvičení
- Vypočítej průměrný plat ve velkých amerických společnostech pomocí sloupce
"salary_in_usd". - Vypočítej celkový součet platů ve velkých amerických společnostech.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____
#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")
# Total salaries in usd
large_companies.groupBy().____.show()