НачатьНачать бесплатно

Агрегирование в PySpark

Теперь вы готовы самостоятельно выполнить агрегирование! Вы будете работать с уже знакомым набором данных о зарплатах. Посмотрим, какие агрегации вы сможете построить! В вашем рабочем пространстве уже доступны сессия SparkSession с именем spark и DataFrame salaries_df.

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Найдите минимальную зарплату в небольшой компании (Small) в США — выполните фильтрацию, обращаясь к столбцу напрямую ("salary_in_usd"), а не передавая SQL-строку.
  • Найдите максимальную зарплату в крупной компании (Large), обозначенной как "L", в США — выполните фильтрацию, обращаясь к столбцу напрямую ("salary_in_usd"), а не передавая SQL-строку.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
Редактировать и запускать код