CommencezCommencez gratuitement

Appliquer un UDF à des données vectorielles

Un dataframe nommé df est disponible avec une colonne output de type vector. Ses cinq premières lignes s'affichent dans la console.

Un UDF get_first_udf est disponible et permet de sélectionner le premier élément d'une colonne vectorielle.

Cette activité fait partie du cours

Introduction à Spark SQL en Python

Voir le cours

Instructions de l’exercice

  • Créez un nouveau dataframe nommé df_new en ajoutant une nouvelle colonne à df. Nommez la nouvelle colonne label.
  • Affichez les cinq premières lignes de df_new.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Add label by applying the get_first_udf to output column
df_new = df.____('____', ____('____'))

# Show the first five rows 
df_new.____
Modifier et exécuter le code