列のアセンブル
データ準備の最終段階として、すべての予測変数列を1つの列にまとめます。
前のいくつかの演習での変更を反映した 更新済み の flights データには、以下の予測変数列があります。
mon、dom、dowcarrier_idx(carrierのインデックス値)org_idx(orgのインデックス値)kmdepartduration
注: show() メソッドの引数 truncate=False を指定すると、出力でデータが切り捨てられなくなります。
この演習はコースの一部です
Machine Learning with PySpark
演習の手順
- 予測変数をアセンブルするクラスをインポートします。
- 予測変数列を1つの列にまとめるアセンブラオブジェクトを作成します。
- アセンブラを使用して、統合された新しい列を生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)