构建交叉验证流水线
现在我们已经有了数据、训练/测试集拆分、模型和超参数取值,接下来需要告诉 Spark 如何对模型进行交叉验证,从而找到最佳的超参数组合并返回给我们。
本练习是课程的一部分
使用 PySpark 构建推荐引擎
练习说明
- 创建一个名为
cv的CrossValidator,以我们的als模型作为 estimator,将estimatorParamMaps设为您刚构建的param_grid。告诉 Spark 使用我们之前构建的"evaluator"作为evaluator。将numFolds设为 5。 - 通过打印
cv来确认已成功构建cv。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Build cross validation using CrossValidator
____ = CrossValidator(estimator=____, estimatorParamMaps=____, evaluator=____, numFolds=____)
# Confirm cv was built
print(____)