使用随机森林预测航班延误
在本练习中,您将把交叉验证与集成方法结合起来。您将训练一个随机森林分类器来预测航班是否延误,并使用交叉验证为模型参数选择最佳取值。
您将为以下参数寻找合适的数值:
featureSubsetStrategy—— 在每个节点进行分裂时考虑的特征数;maxDepth—— 任意分支上允许的最大分裂深度。
遗憾的是,构建该模型耗时过长,因此我们不会在流水线对象上运行 .fit() 方法。
RandomForestClassifier 类已在会话中导入。
本练习是课程的一部分
使用 PySpark 进行机器学习
练习说明
- 创建一个随机森林分类器对象。
- 创建一个参数网格构建器对象。为
featureSubsetStrategy和maxDepth参数添加网格点。 - 创建一个二分类评估器。
- 创建一个交叉验证器对象,指定估计器、参数网格和评估器。选择 5 折交叉验证。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a random forest classifier
forest = ____()
# Create a parameter grid
params = ____() \
.____(____, ['all', 'onethird', 'sqrt', 'log2']) \
.____(____, [2, 5, 10]) \
.____()
# Create a binary classification evaluator
evaluator = ____()
# Create a cross-validator
cv = ____(____, ____, ____, ____)