Zacznij terazZacznij za darmo

Zastosowanie UDF do danych wektorowych

Dostępna jest ramka danych df z kolumną output typu vector. Jej pierwsze pięć wierszy widocznych jest w konsoli.

Dostępny jest UDF get_first_udf, który wybiera pierwszy element kolumny wektorowej.

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark SQL w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz nową ramkę danych o nazwie df_new, dodając nową kolumnę do df. Nazwij nową kolumnę label.
  • Wyświetl pierwsze pięć wierszy ramki df_new.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Add label by applying the get_first_udf to output column
df_new = df.____('____', ____('____'))

# Show the first five rows 
df_new.____
Edytuj i uruchom kod