Seskupování a agregace II
Kromě metod GroupedData, které už znáš, existuje také metoda .agg().
Ta ti umožňuje předat výraz s agregační funkcí z submodulu pyspark.sql.functions.
Tento submodul obsahuje spoustu užitečných funkcí, například pro výpočet směrodatných odchylek. Všechny agregační funkce v tomto submodulu přijímají název sloupce v tabulce GroupedData.
Pamatuj, že v tvém pracovním prostředí je k dispozici SparkSession pojmenovaná spark i Spark DataFrame flights. K dispozici jsou také seskupené DataFramy, které jsi vytvořil/a v předchozím cvičení.
Toto cvičení je součástí kurzu
Foundations of PySpark
Pokyny k cvičení
- Importuj submodul
pyspark.sql.functionsjakoF. - Vytvoř tabulku
GroupedDatas názvemby_month_destseskupenou podle sloupcůmonthidest. Na oba sloupce odkazuj tak, že předáš oba řetězce jako samostatné argumenty. - Použij metodu
.avg()na DataFrameby_month_desta zjisti průměrnédep_delaypro každý měsíc a každé místo určení. - Zjisti směrodatnou odchylku sloupce
dep_delaypomocí metody.agg()s funkcíF.stddev().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pyspark.sql.functions as F
import ____ as F
# Group by month and dest
by_month_dest = flights.groupBy(____)
# Average departure delay by month and destination
by_month_dest.____.show()
# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()