始める無料で始める

列のアセンブル

データ準備の最終段階として、すべての予測変数列を1つの列にまとめます。

前のいくつかの演習での変更を反映した 更新済みflights データには、以下の予測変数列があります。

  • mondomdow
  • carrier_idxcarrier のインデックス値)
  • org_idxorg のインデックス値)
  • km
  • depart
  • duration

注: show() メソッドの引数 truncate=False を指定すると、出力でデータが切り捨てられなくなります。

この演習はコースの一部です

Machine Learning with PySpark

コースを見る

演習の手順

  • 予測変数をアセンブルするクラスをインポートします。
  • 予測変数列を1つの列にまとめるアセンブラオブジェクトを作成します。
  • アセンブラを使用して、統合された新しい列を生成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
コードを編集して実行