肾病案例研究 III:完整流水线
现在是把所有变换与 XGBClassifier 组合起来,构建完整流水线的时候了!
除了您在上一个练习中创建的 numeric_categorical_union,还需要两个变换:我们为您准备好的 Dictifier(),以及 DictVectorizer()。
创建好流水线后,您的任务是对其进行交叉验证,看看模型的表现如何。
本练习是课程的一部分
使用 XGBoost 的极端梯度提升
练习说明
- 使用
numeric_categorical_union、Dictifier()和DictVectorizer(sort=False)这三个变换,以及xgb.XGBClassifier()(设置max_depth=3)这一估计器来创建流水线。将三个变换命名为"featureunion"、"dictifier"、"vectorizer",将估计器命名为"clf"。 - 使用
cross_val_score()对pipeline进行 3 折交叉验证。传入流水线pipeline、特征kidney_data、标签y,并将scoring设为"roc_auc",cv设为3。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create full pipeline
pipeline = ____([
("____", ____),
("____", ____),
("____", ____),
("____", ____)
])
# Perform cross-validation
cross_val_scores = ____(____, ____, ____, ____="____", ____=____)
# Print avg. AUC
print("3-fold AUC: ", np.mean(cross_val_scores))