交叉验证
接下来的几个练习中,您将使用一种称为k 折交叉验证的流程来调优逻辑回归模型。这是一种估计模型在未见数据(例如您的 test DataFrame)上表现的方法。
其做法是将训练数据划分为若干个分区。具体数量由您决定,但在本课程中您将使用 PySpark 的默认值 3。数据划分后,先留出其中一个分区,将模型在其余分区上进行拟合。然后在被留出的分区上衡量误差。对每个分区都重复这一过程,使每一块数据都恰好被留出一次并用作测试集。最后对各分区上的误差取平均。这个平均值称为模型的交叉验证误差,是对留出数据上实际误差的良好估计。
您将通过为两个超参数 elasticNetParam 和 regParam 创建所有可能取值对的网格,并使用交叉验证误差比较所有不同的模型,从而选择最佳超参数!
交叉验证可以让您估计什么?
本练习是课程的一部分
