Vytvoření UDF pro vektorová data
K dispozici máš dataframe df se sloupcem output typu vector. Jeho prvních pět řádků je zobrazeno v konzoli.
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Pokyny k cvičení
- Vytvoř UDF s názvem
first_udf, které vybere první prvek vektorového sloupce. Pro všechny položky, které nejsou vektorem obsahujícím alespoň jeden prvek, nastav výchozí hodnotu 0.0 a výstup přetypuj na float. - Pomocí operace
selectnadfaplikujfirst_udfna sloupecoutput.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)