스키마 추론과 필터링
헤더와 스키마가 있는 인구 조사 데이터셋이 있다고 가정해 봅시다. 그 데이터셋을 로드하고 PySpark가 스키마를 추론하도록 해 보세요. 40세 이상의 성인을 필터링하면 무엇이 보이나요?
워크스페이스에는 이미 SparkSession인 spark가 준비되어 있다는 점을 기억하세요!
이 연습은 강의의 일부입니다
PySpark 입문
연습 안내
- JSON 파일
adults.json을(를) 로드하세요. age가40을 넘는 성인만 포함하도록 데이터를 필터링하세요.- 결과를 표시하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____