그룹화와 집계 II
이미 살펴본 GroupedData 메서드들에 더해, .agg() 메서드도 있습니다.
이 메서드는 pyspark.sql.functions 하위 모듈의 집계 함수를 이용하는 집계 열 표현식을 전달할 수 있게 해요.
이 하위 모듈에는 표준편차처럼 유용한 통계를 계산하는 함수들이 많이 들어 있습니다. 이 하위 모듈의 모든 집계 함수는 GroupedData 테이블의 열 이름을 인수로 받습니다.
워크스페이스에는 이미 spark라는 SparkSession과 Spark DataFrame flights가 준비되어 있어요. 이전 연습 문제에서 만든 그룹화된 DataFrame도 워크스페이스에 있습니다.
이 연습은 강의의 일부입니다
PySpark 기초
연습 안내
- 하위 모듈
pyspark.sql.functions를F로 임포트하세요. month와dest두 열로 그룹화한GroupedData테이블by_month_dest를 만드세요. 두 열 이름 문자열을 별도의 인수로 전달하세요.by_month_destDataFrame에서.avg()메서드를 사용해 각 목적지의 각 월별dep_delay평균을 구하세요.- 함수
F.stddev()를.agg()메서드와 함께 사용해dep_delay의 표준편차를 계산하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import pyspark.sql.functions as F
import ____ as F
# Group by month and dest
by_month_dest = flights.groupBy(____)
# Average departure delay by month and destination
by_month_dest.____.show()
# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()