PySpark에서 집계하기
이제 직접 집계를 해 볼 차례예요!
이미 사용했던 급여 데이터셋을 활용할 거예요. 어떤 집계를 만들 수 있는지 살펴보죠!
작업 공간에는 spark라는 SparkSession과 Spark DataFrame salaries_df가 이미 준비되어 있어요.
이 연습은 강의의 일부입니다
PySpark 입문
연습 안내
- 미국 소재 Small 회사에서의 최소 급여를 구하세요. 필터링은 SQL 문자열을 전달하지 말고 열을 직접 참조하여(
"salary_in_usd") 수행하세요. - 미국 소재 Large 회사(표기는
"L")에서의 최대 급여를 구하세요. 이때도 SQL 문자열을 전달하지 말고 열을 직접 참조하여("salary_in_usd") 필터링하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()