Začněte nyníZačněte zdarma

Vytvoření UDF pro vektorová data

K dispozici máš dataframe df se sloupcem output typu vector. Jeho prvních pět řádků je zobrazeno v konzoli.

Toto cvičení je součástí kurzu

Úvod do Spark SQL v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř UDF s názvem first_udf, které vybere první prvek vektorového sloupce. Pro všechny položky, které nejsou vektorem obsahujícím alespoň jeden prvek, nastav výchozí hodnotu 0.0 a výstup přetypuj na float.
  • Pomocí operace select na df aplikuj first_udf na sloupec output.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
Upravit a spustit kód