模型堆疊 I
現在輪到進行 stacking(堆疊) 了。要實作堆疊方法,你會依照前一部影片提到的 6 個步驟進行:
- 將訓練資料分成兩個部分
- 在第 1 部分上訓練多個模型
- 在第 2 部分上進行預測
- 在測試資料上進行預測
- 以第 2 部分的資料為基礎,使用上述預測作為特徵來訓練一個新模型
- 使用第 2 層模型在測試資料上進行預測
train 與 test 這兩個 DataFrame 已經在你的工作環境中。features 是要用於第 1 部分資料訓練的欄位名稱清單,也已可使用。目標變數名稱為「fare_amount」。
本練習屬於課程
用 Python 拿下 Kaggle 競賽
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from sklearn.model_selection import train_test_split
from sklearn.ensemble import GradientBoostingRegressor, RandomForestRegressor
# Split train data into two parts
part_1, part_2 = ____(train, test_size=____, random_state=123)
# Train a Gradient Boosting model on Part 1
gb = GradientBoostingRegressor().____(____[features], ____.fare_amount)
# Train a Random Forest model on Part 1
rf = RandomForestRegressor().____(____[features], ____.fare_amount)