フライト所要時間モデル:パイプラインモデル
これまで作成したステージをパイプラインにまとめましょう。
パイプラインを構築し、訓練データで学習させます。これにより、パイプライン内の各ステージが順番に訓練データへ適用されます。どのステージもテストデータには一切触れません。漏洩はありません!
パイプライン全体の学習が終わったら、テストデータに対して予測を行います。
データは flights として用意されており、flights_train と flights_test にランダムに分割されています。
この演習はコースの一部です
Machine Learning with PySpark
演習の手順
- パイプラインを作成するクラスをインポートします。
indexer、onehot、assembler、regressionの順にステージを指定してパイプラインオブジェクトを作成します。- 訓練データでパイプラインを学習させます。
- テストデータで予測を行います。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import class for creating a pipeline
from pyspark.____ import ____
# Construct a pipeline
pipeline = ____(____=[____])
# Train the pipeline on the training data
pipeline = pipeline.____(____)
# Make predictions on the testing data
predictions = ____.____(____)