НачатьНачать бесплатно

Создание UDF для векторных данных

Доступен датафрейм df со столбцом output типа vector. Первые пять строк показаны в консоли.

Это упражнение является частью курса

Введение в Spark SQL на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте UDF с именем first_udf, которая выбирает первый элемент векторного столбца. Установите значение по умолчанию 0.0 для любого элемента, который не является вектором с хотя бы одним элементом, и приведите результат к типу float.
  • Примените first_udf к столбцу output датафрейма df с помощью операции select.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
Редактировать и запускать код