Agregări în PySpark
Acum ești pregătit să faci propriile agregări!
Vei folosi un set de date cu salarii pe care l-ai mai utilizat. Să vedem ce agregări poți crea!
În spațiul tău de lucru sunt deja disponibile o sesiune SparkSession numită spark și DataFrame-ul Spark salaries_df.
Acest exercițiu face parte din cursul
Introducere în PySpark
Instrucțiuni pentru exercițiu
- Găsește salariul minim dintr-o companie mică din SUA – aplică filtrarea referindu-te direct la coloană (
"salary_in_usd"), nu printr-un șir SQL. - Găsește salariul maxim dintr-o companie mare din SUA, notată cu
"L"– aplică filtrarea referindu-te direct la coloană ("salary_in_usd"), nu printr-un șir SQL.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()