模型堆叠 I
现在是进行堆叠(stacking)的时候了。为实现堆叠方法,您将按照上一段视频中讲到的 6 个步骤操作:
- 将训练数据拆分为两部分。
- 在第 1 部分上训练多个模型。
- 在第 2 部分上进行预测。
- 在测试数据上进行预测。
- 使用第 2 部分上的预测作为特征,训练一个新模型。
- 使用二级模型在测试数据上进行预测。
train 和 test DataFrame 已在您的工作区中可用。features 是用于在第 1 部分数据上训练的列名列表,也已在您的工作区中提供。目标变量名为 "fare_amount"。
本练习是课程的一部分
用 Python 赢下 Kaggle 竞赛
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.model_selection import train_test_split
from sklearn.ensemble import GradientBoostingRegressor, RandomForestRegressor
# Split train data into two parts
part_1, part_2 = ____(train, test_size=____, random_state=123)
# Train a Gradient Boosting model on Part 1
gb = GradientBoostingRegressor().____(____[features], ____.fare_amount)
# Train a Random Forest model on Part 1
rf = RandomForestRegressor().____(____[features], ____.fare_amount)