欠拟合/过拟合导致的误差
这个糖果数据集非常容易过拟合。只有 85 条观测,如果将其中的 20% 用作测试集,您就会失去许多本可用于建模的关键信息。设想一种情况:大多数巧克力糖果被分到了训练集,而保留样本中很少。模型可能只"看到"巧克力这个因素很关键,却没能发现其他属性也同样重要。在本练习中,您将探索在随机森林模型中使用过多特征(列)如何导致过拟合。
一个「特征」表示在决策树中可以使用的数据列。参数 max_features 用于限制可用特征的数量。
本练习是课程的一部分
Python 中的模型验证
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Update the rfr model
rfr = RandomForestRegressor(____=25,
____=1111,
____=2)
rfr.fit(X_train, y_train)
# Print the training and testing accuracies
print('The training error is {0:.2f}'.format(
mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
mae(y_test, rfr.predict(X_test))))