ベクターを組み立てる
Pipeline の最後のステップでは、特徴量を含むすべての列を1つの列にまとめます。Spark のモデリング手法はすべて、この形式のデータを想定しているため、モデリングの前に必ず行う必要があります。これを行うには、各列の値をベクターの要素として格納します。すると、モデルの観点では、各観測はそれに関するすべての情報を含むベクターと、その観測がどの値に対応するかを示すラベルから成ることになります。
このため、pyspark.ml.feature サブモジュールには VectorAssembler というクラスがあります。この Transformer は、指定したすべての列を受け取り、新しいベクター列に結合します。
この演習はコースの一部です
PySpark入門
演習の手順
VectorAssembler()を呼び出し、inputColsに列名のリスト、outputColに"features"を指定してVectorAssemblerを作成します。- 列のリストは
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"]とします。
- 列のリストは
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)