Групування та агрегація II
Окрім методів GroupedData, які ви вже бачили, є також метод .agg().
Він дає змогу передати вираз агрегованого стовпця, що використовує будь-яку з агрегувальних функцій із підмодуля pyspark.sql.functions.
У цьому підмодулі є багато корисних функцій для обчислення, зокрема, стандартного відхилення. Усі агрегувальні функції з цього підмодуля приймають назву стовпця у таблиці GroupedData.
Пам'ятайте: SparkSession під назвою spark уже доступний у вашому робочому середовищі, так само як і датафрейм Spark flights. Згруповані датафрейми, які ви створили в попередній вправі, також доступні у вашому середовищі.
Ця вправа є частиною курсу
Основи PySpark
Інструкції до вправи
- Імпортуйте підмодуль
pyspark.sql.functionsякF. - Створіть таблицю
GroupedDataз назвоюby_month_dest, згруповану одночасно за стовпцямиmonthіdest. Передайте обидва стовпці як окремі рядкові аргументи. - Застосуйте метод
.avg()до датафреймуby_month_dest, щоб отримати середнє значенняdep_delayу кожному місяці для кожного аеропорту призначення. - Знайдіть стандартне відхилення
dep_delay, використавши метод.agg()з функцієюF.stddev().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import pyspark.sql.functions as F
import ____ as F
# Group by month and dest
by_month_dest = flights.groupBy(____)
# Average departure delay by month and destination
by_month_dest.____.show()
# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()