Créer un UDF pour des données vectorielles
Un dataframe df est disponible, avec une colonne output de type vector. Ses cinq premières lignes sont affichées dans la console.
Cette activité fait partie du cours
Introduction à Spark SQL en Python
Instructions de l’exercice
- Créez un UDF nommé
first_udf. Il sélectionne le premier élément d'une colonne vectorielle. Prévoyez une valeur par défaut de 0.0 pour tout élément qui n'est pas un vecteur contenant au moins un élément et convertissez la sortie en nombre à virgule flottante. - Utilisez l'opération
selectsurdfpour appliquerfirst_udfà la colonneoutput.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)