ベクターデータへの UDF の適用
vector 型の列 output を持つデータフレーム df が利用可能です。最初の 5 行はコンソールに表示されています。
ベクター列の最初の要素を選択する UDF get_first_udf が用意されています。
この演習はコースの一部です
Pythonで学ぶ Spark SQL 入門
演習の手順
dfに新しい列を追加して、新しいデータフレームdf_newを作成します。新しい列名はlabelとします。df_newの先頭 5 行を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Add label by applying the get_first_udf to output column
df_new = df.____('____', ____('____'))
# Show the first five rows
df_new.____