ÎncepețiÎncepe gratuit

Crearea unui UDF pentru date de tip vector

Este disponibil un DataFrame df cu o coloană output de tip vector. Primele cinci rânduri sunt afișate în consolă.

Acest exercițiu face parte din cursul

Introducere în Spark SQL în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un UDF numit first_udf. Acesta selectează primul element dintr-o coloană de tip vector. Setează valoarea implicită la 0.0 pentru orice element care nu este un vector ce conține cel puțin un item și convertește rezultatul la tipul float.
  • Folosește operația select pe df pentru a aplica first_udf coloanei output.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
Editează și rulează codul