시작하기무료로 시작하기

그룹화와 집계 I

집계의 강력함은 그룹을 추가할 때 더욱 빛납니다. PySpark에는 그룹화된 데이터 프레임을 위한 전용 클래스 pyspark.sql.GroupedData가 있으며, 바로 앞의 두 연습 문제에서 보셨습니다.

인수를 주지 않고 DataFrame에서 .groupBy() 메서드를 호출해 그룹화된 DataFrame을 만드는 방법을 학습하셨습니다.

이번에는 DataFrame의 하나 이상의 열 이름을 .groupBy() 메서드에 전달하면, 집계 메서드가 SQL 쿼리의 GROUP BY 구문처럼 동작한다는 것을 확인하겠습니다!

워크스페이스에는 이미 spark라는 SparkSession과 Spark DataFrame flights가 준비되어 있습니다.

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

연습 안내

  • tailnum 열로 그룹화한 DataFrame by_plane을(를) 만드세요.
  • 인수 없이 .count() 메서드를 사용해 각 비행기가 수행한 항공편 수를 세세요.
  • origin 열로 그룹화한 DataFrame by_origin을(를) 만드세요.
  • PDX와 SEA 출발 항공편의 평균 비행 시간을 구하기 위해 air_time 열의 .avg()를 계산하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Group by tailnum
by_plane = flights.groupBy("____")

# Number of flights each plane made
by_plane.____.show()

# Group by origin
by_origin = flights.groupBy("____")

# Average duration of flights from PDX and SEA
by_origin.avg("____").show()
코드 편집 및 실행