始める無料で始める

ベクトルデータ用のUDFを作成する

vector 型の列 output を持つデータフレーム df が用意されています。最初の5行はコンソールに表示されています。

この演習はコースの一部です

Pythonで学ぶ Spark SQL 入門

コースを見る

演習の手順

  • first_udf というUDFを作成します。これはベクトル列の先頭要素を取り出します。少なくとも1つの要素を含むベクトルでない項目については、既定値の 0.0 を返すようにし、出力は float にキャストします。
  • df に対して select を使い、output 列に first_udf を適用します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Selects the first element of a vector column
first_udf = ____(lambda x:
            ____(x.indices[0]) 
            if (x and hasattr(x, "toArray") and x.____())
            else 0.0,
            FloatType())

# Apply first_udf to the output column
df.select(____("output").alias("result")).show(5)
コードを編集して実行