Створення UDF для векторних даних
Доступний датафрейм df зі стовпцем output типу vector. Перші п'ять рядків показано в консолі.
Ця вправа є частиною курсу
Вступ до Spark SQL у Python
Інструкції до вправи
- Створіть UDF під назвою
first_udf. Вона вибирає перший елемент зі стовпця-вектора. Встановіть значення за замовчуванням 0.0 для будь-якого елемента, який не є вектором з принаймні одним елементом, і приведіть результат до типу float. - Використайте операцію
selectдляdf, щоб застосуватиfirst_udfдо стовпцяoutput.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)