시작하기무료로 시작하기

그룹화와 집계 II

이미 살펴본 GroupedData 메서드들에 더해, .agg() 메서드도 있습니다. 이 메서드는 pyspark.sql.functions 하위 모듈의 집계 함수를 이용하는 집계 열 표현식을 전달할 수 있게 해요.

이 하위 모듈에는 표준편차처럼 유용한 통계를 계산하는 함수들이 많이 들어 있습니다. 이 하위 모듈의 모든 집계 함수는 GroupedData 테이블의 열 이름을 인수로 받습니다.

워크스페이스에는 이미 spark라는 SparkSession과 Spark DataFrame flights가 준비되어 있어요. 이전 연습 문제에서 만든 그룹화된 DataFrame도 워크스페이스에 있습니다.

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

연습 안내

  • 하위 모듈 pyspark.sql.functionsF로 임포트하세요.
  • monthdest 두 열로 그룹화한 GroupedData 테이블 by_month_dest를 만드세요. 두 열 이름 문자열을 별도의 인수로 전달하세요.
  • by_month_dest DataFrame에서 .avg() 메서드를 사용해 각 목적지의 각 월별 dep_delay 평균을 구하세요.
  • 함수 F.stddev().agg() 메서드와 함께 사용해 dep_delay의 표준편차를 계산하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import pyspark.sql.functions as F
import ____ as F

# Group by month and dest
by_month_dest = flights.groupBy(____)

# Average departure delay by month and destination
by_month_dest.____.show()

# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()
코드 편집 및 실행