Агрегирование в PySpark
Теперь вы готовы самостоятельно выполнить агрегирование!
Вы будете работать с уже знакомым набором данных о зарплатах. Посмотрим, какие агрегации вы сможете построить!
В вашем рабочем пространстве уже доступны сессия SparkSession с именем spark и DataFrame salaries_df.
Это упражнение является частью курса
Введение в PySpark
Инструкции к упражнению
- Найдите минимальную зарплату в небольшой компании (Small) в США — выполните фильтрацию, обращаясь к столбцу напрямую (
"salary_in_usd"), а не передавая SQL-строку. - Найдите максимальную зарплату в крупной компании (Large), обозначенной как
"L", в США — выполните фильтрацию, обращаясь к столбцу напрямую ("salary_in_usd"), а не передавая SQL-строку.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()