벡터 데이터용 UDF 만들기
벡터 타입의 output 열을 가진 데이터프레임 df가 제공되어 있어요. 콘솔에는 처음 다섯 개 행이 표시되어 있습니다.
이 연습은 강의의 일부입니다
Python에서 Spark SQL 입문
연습 안내
first_udf라는 UDF를 만드세요. 이 함수는 벡터 열의 첫 번째 원소를 선택합니다. 하나 이상의 원소를 포함한 벡터가 아닌 항목에 대해서는 기본값 0.0을 반환하고, 출력은 float으로 캐스팅하세요.df에 대해select연산을 사용해output열에first_udf를 적용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)