Zastosowanie UDF do danych wektorowych
Dostępna jest ramka danych df z kolumną output typu vector. Jej pierwsze pięć wierszy widocznych jest w konsoli.
Dostępny jest UDF get_first_udf, który wybiera pierwszy element kolumny wektorowej.
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Instrukcje do ćwiczenia
- Utwórz nową ramkę danych o nazwie
df_new, dodając nową kolumnę dodf. Nazwij nową kolumnęlabel. - Wyświetl pierwsze pięć wierszy ramki
df_new.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Add label by applying the get_first_udf to output column
df_new = df.____('____', ____('____'))
# Show the first five rows
df_new.____