Tworzenie UDF dla danych wektorowych
Dostępna jest ramka danych df z kolumną output typu vector. Jej pierwszych pięć wierszy widać w konsoli.
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Instrukcje do ćwiczenia
- Utwórz UDF o nazwie
first_udf, który wybiera pierwszy element kolumny wektorowej. Ustaw wartość domyślną na 0.0 dla elementów, które nie są wektorami zawierającymi co najmniej jeden element, i rzutuj wynik na typ float. - Użyj operacji
selectnadf, aby zastosowaćfirst_udfdo kolumnyoutput.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Selects the first element of a vector column
first_udf = ____(lambda x:
____(x.indices[0])
if (x and hasattr(x, "toArray") and x.____())
else 0.0,
FloatType())
# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)