开始使用免费开始使用

蘑菇:关乎生死的判断

让我们以蘑菇可食性的判别问题为课程收尾。您将尝试使用堆叠(stacking)分类器,看看分数是否能进一步提升。由于 stacking 使用元估计器(第二层分类器)来纠正第一层的预测,部分被误分的样本可能会被修正。这是一个非常重要的问题,因为蘑菇是否可食,关乎生死。

数据集已加载并划分为训练集和测试集。您认为 stacking 能否帮助更有把握地预测蘑菇的可食性?

本练习是课程的一部分

Python 中的集成方法

查看课程

练习说明

  • 实例化第一层估计器:使用 ball tree 算法的 5-近邻分类器,一个参数为 min_samples_leaf = 5min_samples_split = 15 的决策树分类器,以及一个高斯朴素贝叶斯分类器。
  • 构建并拟合一个堆叠分类器,使用参数 classifiers(包含第一层分类器的列表)和 meta_classifier(默认的逻辑回归)。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create the first-layer models
clf_knn = ____
clf_dt = ____(____, ____, random_state=500)
clf_nb = ____

# Create the second-layer model (meta-model)
clf_lr = LogisticRegression()

# Create and fit the stacked model
clf_stack = ____
clf_stack.fit(X_train, y_train)

# Evaluate the stacked model’s performance
print("Accuracy: {:0.4f}".format(accuracy_score(y_test, clf_stack.predict(X_test))))
编辑并运行代码