整合所学
好了,是时候把目前为止学到的内容整合起来了!在本课程的最后一个练习中,您将把前面练习的工作合并为一个端到端的 XGBoost 流水线,进一步加深对 XGBoost 中预处理与流水线的理解。
您在前 3 个练习中完成的数据预处理与流水线搭建已预先加载。您的任务是执行随机搜索并找出最佳超参数。
本练习是课程的一部分
使用 XGBoost 的极端梯度提升
练习说明
- 设置参数网格,调优
'clf__learning_rate'(从0.05到1,步长0.05)、'clf__max_depth'(从3到10,步长1)以及'clf__n_estimators'(从50到200,步长50)。 - 以您的
pipeline作为估计器,执行 2 折的RandomizedSearchCV,并将n_iter设为2。使用"roc_auc"作为评估指标,将verbose设为1以获得更详细的输出。将结果存储在randomized_roc_auc中。 - 将
randomized_roc_auc拟合到X和y。 - 计算并获取
randomized_roc_auc的最佳分数与最佳估计器。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create the parameter grid
gbm_param_grid = {
'____': ____(____, ____, ____),
'____': ____(____, ____, ____),
'____': ____(____, ____, ____)
}
# Perform RandomizedSearchCV
randomized_roc_auc = ____
# Fit the estimator
____
# Compute metrics
print(____)
print(____)