Skapa en UDF för vektordata
En dataram df finns tillgänglig med en kolumn output av typen vector. De fem första raderna visas i konsolen.
Den här övningen är en del av kursen
Introduktion till Spark SQL i Python
Övningsinstruktioner
- Skapa en UDF med namnet
first_udfsom väljer det första elementet i en vektorkolumn. Sätt standardvärdet till 0.0 för alla element som inte är en vektor med minst ett element, och konvertera utdata till en float. - Använd operationen
selectpådfför att tillämpafirst_udfpå kolumnenoutput.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)