构建随机森林模型
这里,您将使用相同的交叉验证数据,在每个分区上构建(使用 train)并评估(使用 validate)随机森林。由于与回归模型使用的是同一组交叉验证分区,您可以直接比较两类模型的性能。
注意: 为保证训练能在合理时间内完成,我们将随机森林限制为包含 100 棵树。ranger() 的默认树数量为 500。
本练习是课程的一部分
Tidyverse 中的机器学习
练习说明
- 使用
ranger()在每个交叉验证分区上,基于train中的全部特征,构建预测life_expectancy的随机森林模型。 - 新增一列
validate_predicted,使用刚刚创建的随机森林模型,对validate中的观测的life_expectancy进行预测。
交互式实操练习
通过完成这段示例代码来试试这个练习。
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))