PySpark UDF에서의 정수 처리
이번 연습 문제에서는 UDF를 다루며, PySpark에서 함수를 만드는 방법을 이해하실 수 있어요! 이 작업이 데이터 정제(workflow)에서 무엇을 대체할 수 있을지 생각해 보세요.
작업 공간에는 이미 SparkSession인 spark가 준비되어 있다는 점을 기억하세요!
이 연습은 강의의 일부입니다
PySpark 입문
연습 안내
- 함수
age_category를age_category_udf라는 이름의 UDF로 등록하세요. - DataFrame
df에 새 열"category"를 추가하고, 나이에 따라 사람을 분류하도록 UDF를 적용하세요.age_category_udf()에 전달할 인자는 미리 제공되어 있어요. - 결과 DataFrame을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Register the function age_category as a UDF
age_category_udf = ____(age_category, StringType())
# Apply your udf to the DataFrame
age_category_df_2 = age_category_df.withColumn("category", ____(age_category_df["age"]))
# Show df
age_category_df_2.____