ПочатиПочніть безкоштовно

Групування та агрегація II

Окрім методів GroupedData, які ви вже бачили, є також метод .agg(). Він дає змогу передати вираз агрегованого стовпця, що використовує будь-яку з агрегувальних функцій із підмодуля pyspark.sql.functions.

У цьому підмодулі є багато корисних функцій для обчислення, зокрема, стандартного відхилення. Усі агрегувальні функції з цього підмодуля приймають назву стовпця у таблиці GroupedData.

Пам'ятайте: SparkSession під назвою spark уже доступний у вашому робочому середовищі, так само як і датафрейм Spark flights. Згруповані датафрейми, які ви створили в попередній вправі, також доступні у вашому середовищі.

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте підмодуль pyspark.sql.functions як F.
  • Створіть таблицю GroupedData з назвою by_month_dest, згруповану одночасно за стовпцями month і dest. Передайте обидва стовпці як окремі рядкові аргументи.
  • Застосуйте метод .avg() до датафрейму by_month_dest, щоб отримати середнє значення dep_delay у кожному місяці для кожного аеропорту призначення.
  • Знайдіть стандартне відхилення dep_delay, використавши метод .agg() з функцією F.stddev().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import pyspark.sql.functions as F
import ____ as F

# Group by month and dest
by_month_dest = flights.groupBy(____)

# Average departure delay by month and destination
by_month_dest.____.show()

# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()
Редагувати та запускати код