始める無料で始める

ベクターデータへの UDF の適用

vector 型の列 output を持つデータフレーム df が利用可能です。最初の 5 行はコンソールに表示されています。

ベクター列の最初の要素を選択する UDF get_first_udf が用意されています。

この演習はコースの一部です

Pythonで学ぶ Spark SQL 入門

コースを見る

演習の手順

  • df に新しい列を追加して、新しいデータフレーム df_new を作成します。新しい列名は label とします。
  • df_new の先頭 5 行を表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Add label by applying the get_first_udf to output column
df_new = df.____('____', ____('____'))

# Show the first five rows 
df_new.____
コードを編集して実行