Začněte nyníZačněte zdarma

Seskupování a agregace II

Kromě metod GroupedData, které už znáš, existuje také metoda .agg(). Ta ti umožňuje předat výraz s agregační funkcí z submodulu pyspark.sql.functions.

Tento submodul obsahuje spoustu užitečných funkcí, například pro výpočet směrodatných odchylek. Všechny agregační funkce v tomto submodulu přijímají název sloupce v tabulce GroupedData.

Pamatuj, že v tvém pracovním prostředí je k dispozici SparkSession pojmenovaná spark i Spark DataFrame flights. K dispozici jsou také seskupené DataFramy, které jsi vytvořil/a v předchozím cvičení.

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Pokyny k cvičení

  • Importuj submodul pyspark.sql.functions jako F.
  • Vytvoř tabulku GroupedData s názvem by_month_dest seskupenou podle sloupců month i dest. Na oba sloupce odkazuj tak, že předáš oba řetězce jako samostatné argumenty.
  • Použij metodu .avg() na DataFrame by_month_dest a zjisti průměrné dep_delay pro každý měsíc a každé místo určení.
  • Zjisti směrodatnou odchylku sloupce dep_delay pomocí metody .agg() s funkcí F.stddev().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import pyspark.sql.functions as F
import ____ as F

# Group by month and dest
by_month_dest = flights.groupBy(____)

# Average departure delay by month and destination
by_month_dest.____.show()

# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()
Upravit a spustit kód