始める無料で始める

モデルスタッキング I

いよいよスタッキング(stacking)です。スタッキングを実装するために、前の動画で説明した6つの手順に従いましょう。

  1. 学習データを2つの部分に分割する
  2. Part 1 上で複数のモデルを学習する
  3. Part 2 に対して予測を行う
  4. テストデータに対して予測を行う
  5. Part 2 のデータに対して、予測値を特徴量として用いて新しいモデルを学習する
  6. 第2レベルのモデルを使ってテストデータの予測を行う

traintest の各DataFrameはワークスペースに用意されています。features は Part 1 の学習に用いる列名のリストで、こちらもワークスペースに用意されています。目的変数名は "fare_amount" です。

この演習はコースの一部です

Pythonで挑むKaggleコンペティション

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from sklearn.model_selection import train_test_split
from sklearn.ensemble import GradientBoostingRegressor, RandomForestRegressor

# Split train data into two parts
part_1, part_2 = ____(train, test_size=____, random_state=123)

# Train a Gradient Boosting model on Part 1
gb = GradientBoostingRegressor().____(____[features], ____.fare_amount)

# Train a Random Forest model on Part 1
rf = RandomForestRegressor().____(____[features], ____.fare_amount)
コードを編集して実行