Создание UDF для векторных данных
Доступен датафрейм df со столбцом output типа vector. Первые пять строк показаны в консоли.
Это упражнение является частью курса
Введение в Spark SQL на Python
Инструкции к упражнению
- Создайте UDF с именем
first_udf, которая выбирает первый элемент векторного столбца. Установите значение по умолчанию 0.0 для любого элемента, который не является вектором с хотя бы одним элементом, и приведите результат к типу float. - Примените
first_udfк столбцуoutputдатафреймаdfс помощью операцииselect.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)