比较 KNN 与中位数插补
在 train() 函数中,所有预处理步骤都会在每个交叉验证折的训练集上执行,因此报告的误差度量已经包含了预处理的影响。
这也包括所用的插补方法(例如 knnImpute 或 medianImpute)。这很有用,因为这样您就可以比较不同的插补方法,并选择在样本外表现最好的方法。
median_model 和 knn_model 已在您的工作空间中,同时还有 resamples,其中包含两个模型的重采样结果。通过运行下列代码查看模型结果:
dotplot(resamples, metric = "ROC")
然后选择样本外表现最好的一个。对于您的 glm 模型,哪种插补方法的样本外 ROC 分数最高?
本练习是课程的一部分
