开始使用免费开始使用

构建随机森林模型

这里,您将使用相同的交叉验证数据,在每个分区上构建(使用 train)并评估(使用 validate)随机森林。由于与回归模型使用的是同一组交叉验证分区,您可以直接比较两类模型的性能。

注意: 为保证训练能在合理时间内完成,我们将随机森林限制为包含 100 棵树。ranger() 的默认树数量为 500。

本练习是课程的一部分

Tidyverse 中的机器学习

查看课程

练习说明

  • 使用 ranger() 在每个交叉验证分区上,基于 train 中的全部特征,构建预测 life_expectancy 的随机森林模型。
  • 新增一列 validate_predicted,使用刚刚创建的随机森林模型,对 validate 中的观测的 life_expectancy 进行预测。

交互式实操练习

通过完成这段示例代码来试试这个练习。

library(ranger)

# Build a random forest model for each fold
cv_models_rf <- cv_data %>% 
  mutate(model = map(___, ~ranger(formula = ___, data = ___,
                                    num.trees = 100, seed = 42)))

# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>% 
  mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))
编辑并运行代码