开始使用免费开始使用

肾病案例研究 III:完整流水线

现在是把所有变换与 XGBClassifier 组合起来,构建完整流水线的时候了!

除了您在上一个练习中创建的 numeric_categorical_union,还需要两个变换:我们为您准备好的 Dictifier(),以及 DictVectorizer()

创建好流水线后,您的任务是对其进行交叉验证,看看模型的表现如何。

本练习是课程的一部分

使用 XGBoost 的极端梯度提升

查看课程

练习说明

  • 使用 numeric_categorical_unionDictifier()DictVectorizer(sort=False) 这三个变换,以及 xgb.XGBClassifier()(设置 max_depth=3)这一估计器来创建流水线。将三个变换命名为 "featureunion""dictifier""vectorizer",将估计器命名为 "clf"
  • 使用 cross_val_score()pipeline 进行 3 折交叉验证。传入流水线 pipeline、特征 kidney_data、标签 y,并将 scoring 设为 "roc_auc"cv 设为 3

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create full pipeline
pipeline = ____([
                     ("____", ____),
                     ("____", ____),
                     ("____", ____),
                     ("____", ____)
                    ])

# Perform cross-validation
cross_val_scores = ____(____, ____, ____, ____="____", ____=____)

# Print avg. AUC
print("3-fold AUC: ", np.mean(cross_val_scores))
编辑并运行代码