开始使用免费开始使用

变量重要性

您已经知道,袋装树是一种集成模型,能够克服决策树的方差问题。现在您还了解到,随机森林算法在此基础上进一步改进:在每棵树中仅使用特征的随机子集。这样可以进一步降低集成内各基学习器之间的相关性,从而提升预测性能。

在本练习中,您将亲自构建一个随机森林,并使用 vip 包绘制预测变量的重要性。训练数据 customers_train 已预先加载到您的工作区。

本练习是课程的一部分

R 中的树模型机器学习

查看课程

练习说明

  • 使用 "ranger" 引擎和 "impurity" 变量重要性创建随机森林分类模型的规范 spec
  • 基于 tibble customers_train 拟合 spec,创建 model,其中以 still_customer 作为因变量,其他所有列作为自变量。
  • 使用未预加载的 vip 包中的 vip() 函数绘制变量重要性。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Specify a random forest
spec <- ___ %>%
	set_mode("classification") %>%
    set_engine(___, importance = ___)

# Train the forest
model <- spec %>%
    fit(___,
        ___)

# Plot the variable importance
vip::___(model)
编辑并运行代码