Агрегування в PySpark
Тепер ви готові виконати власні агрегування!
Ви працюватимете з набором даних про зарплати, який уже використовували. Подивімося, які агрегати ви можете отримати!
У вашому робочому середовищі вже створено SparkSession з назвою spark, а також доступний датафрейм Spark salaries_df.
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Знайдіть мінімальну зарплату в компанії США малого розміру — виконайте фільтрування, звертаючись до стовпця безпосередньо (
"salary_in_usd"), а не передаючи SQL-рядок. - Знайдіть максимальну зарплату в компанії США великого розміру, позначеного як
"L"— виконайте фільтрування, звертаючись до стовпця безпосередньо ("salary_in_usd"), а не передаючи SQL-рядок.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()