시작하기무료로 시작하기

PySpark UDF에서의 정수 처리

이번 연습 문제에서는 UDF를 다루며, PySpark에서 함수를 만드는 방법을 이해하실 수 있어요! 이 작업이 데이터 정제(workflow)에서 무엇을 대체할 수 있을지 생각해 보세요.

작업 공간에는 이미 SparkSessionspark가 준비되어 있다는 점을 기억하세요!

이 연습은 강의의 일부입니다

PySpark 입문

강의 보기

연습 안내

  • 함수 age_categoryage_category_udf라는 이름의 UDF로 등록하세요.
  • DataFrame df에 새 열 "category"를 추가하고, 나이에 따라 사람을 분류하도록 UDF를 적용하세요. age_category_udf()에 전달할 인자는 미리 제공되어 있어요.
  • 결과 DataFrame을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Register the function age_category as a UDF
age_category_udf = ____(age_category, StringType())

# Apply your udf to the DataFrame
age_category_df_2 = age_category_df.withColumn("category", ____(age_category_df["age"]))

# Show df
age_category_df_2.____
코드 편집 및 실행