モデルスタッキング I
いよいよスタッキング(stacking)です。スタッキングを実装するために、前の動画で説明した6つの手順に従いましょう。
- 学習データを2つの部分に分割する
- Part 1 上で複数のモデルを学習する
- Part 2 に対して予測を行う
- テストデータに対して予測を行う
- Part 2 のデータに対して、予測値を特徴量として用いて新しいモデルを学習する
- 第2レベルのモデルを使ってテストデータの予測を行う
train と test の各DataFrameはワークスペースに用意されています。features は Part 1 の学習に用いる列名のリストで、こちらもワークスペースに用意されています。目的変数名は "fare_amount" です。
この演習はコースの一部です
Pythonで挑むKaggleコンペティション
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.model_selection import train_test_split
from sklearn.ensemble import GradientBoostingRegressor, RandomForestRegressor
# Split train data into two parts
part_1, part_2 = ____(train, test_size=____, random_state=123)
# Train a Gradient Boosting model on Part 1
gb = GradientBoostingRegressor().____(____[features], ____.fare_amount)
# Train a Random Forest model on Part 1
rf = RandomForestRegressor().____(____[features], ____.fare_amount)