ПочатиПочніть безкоштовно

Створення UDF для векторних даних

Доступний датафрейм df зі стовпцем output типу vector. Перші п'ять рядків показано в консолі.

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Інструкції до вправи

  • Створіть UDF під назвою first_udf. Вона вибирає перший елемент зі стовпця-вектора. Встановіть значення за замовчуванням 0.0 для будь-якого елемента, який не є вектором з принаймні одним елементом, і приведіть результат до типу float.
  • Використайте операцію select для df, щоб застосувати first_udf до стовпця output.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
Редагувати та запускати код