시작하기무료로 시작하기

PySpark에서 집계하기

이제 직접 집계를 해 볼 차례예요! 이미 사용했던 급여 데이터셋을 활용할 거예요. 어떤 집계를 만들 수 있는지 살펴보죠! 작업 공간에는 spark라는 SparkSession과 Spark DataFrame salaries_df가 이미 준비되어 있어요.

이 연습은 강의의 일부입니다

PySpark 입문

강의 보기

연습 안내

  • 미국 소재 Small 회사에서의 최소 급여를 구하세요. 필터링은 SQL 문자열을 전달하지 말고 열을 직접 참조하여("salary_in_usd") 수행하세요.
  • 미국 소재 Large 회사(표기는 "L")에서의 최대 급여를 구하세요. 이때도 SQL 문자열을 전달하지 말고 열을 직접 참조하여("salary_in_usd") 필터링하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
코드 편집 및 실행