Zacznij terazZacznij za darmo

Tworzenie UDF dla danych wektorowych

Dostępna jest ramka danych df z kolumną output typu vector. Jej pierwszych pięć wierszy widać w konsoli.

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark SQL w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz UDF o nazwie first_udf, który wybiera pierwszy element kolumny wektorowej. Ustaw wartość domyślną na 0.0 dla elementów, które nie są wektorami zawierającymi co najmniej jeden element, i rzutuj wynik na typ float.
  • Użyj operacji select na df, aby zastosować first_udf do kolumny output.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
Edytuj i uruchom kod