ПочатиПочніть безкоштовно

Агрегування в PySpark

Тепер ви готові виконати власні агрегування! Ви працюватимете з набором даних про зарплати, який уже використовували. Подивімося, які агрегати ви можете отримати! У вашому робочому середовищі вже створено SparkSession з назвою spark, а також доступний датафрейм Spark salaries_df.

Ця вправа є частиною курсу

Вступ до PySpark

Переглянути курс

Інструкції до вправи

  • Знайдіть мінімальну зарплату в компанії США малого розміру — виконайте фільтрування, звертаючись до стовпця безпосередньо ("salary_in_usd"), а не передаючи SQL-рядок.
  • Знайдіть максимальну зарплату в компанії США великого розміру, позначеного як "L" — виконайте фільтрування, звертаючись до стовпця безпосередньо ("salary_in_usd"), а не передаючи SQL-рядок.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
Редагувати та запускати код