构建并评估更大的树
之前,您构建了一个简单的决策树,使用申请人的信用评分和申请贷款金额来预测放贷结果。
Lending Club 还拥有关于申请人的更多信息,例如房屋所有权状态、就业年限、贷款用途以及以往破产记录等,这些都可能有助于做出更准确的预测。
请使用所有可用的申请人数据,基于之前创建的随机训练数据集,构建一个更复杂的放贷模型。然后,将该模型用于测试数据集进行预测,以估计该模型在未来贷款申请上的表现。
rpart 包已预先加载,loans_train 和 loans_test 数据集也已创建。
本练习是课程的一部分
R 中的监督学习:分类
练习说明
- 使用
rpart()基于训练数据集和所有可用的预测变量来构建放贷模型。同样,保持control参数不变。 - 将
predict()函数应用到测试数据集,创建一个预测结果向量。别忘了设置type参数。 - 使用
table()比较预测值与实际的outcome值。 - 使用
mean()函数计算预测的准确率。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Grow a tree using all of the available applicant data
loan_model <- rpart(___, data = ___, method = "___", control = rpart.control(cp = 0))
# Make predictions on the test dataset
loans_test$pred <- ___
# Examine the confusion matrix
table(___, ___)
# Compute the accuracy on the test dataset
mean(___)