变量重要性
您已经知道,袋装树是一种集成模型,能够克服决策树的方差问题。现在您还了解到,随机森林算法在此基础上进一步改进:在每棵树中仅使用特征的随机子集。这样可以进一步降低集成内各基学习器之间的相关性,从而提升预测性能。
在本练习中,您将亲自构建一个随机森林,并使用 vip 包绘制预测变量的重要性。训练数据 customers_train 已预先加载到您的工作区。
本练习是课程的一部分
R 中的树模型机器学习
练习说明
- 使用
"ranger"引擎和"impurity"变量重要性创建随机森林分类模型的规范spec。 - 基于 tibble
customers_train拟合spec,创建model,其中以still_customer作为因变量,其他所有列作为自变量。 - 使用未预加载的
vip包中的vip()函数绘制变量重要性。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)