避免多重共线性
回到已经加载到工作区的数据集 salesData。另外,rms 包也已加载。
现在来估计一个多元线性回归模型!当然,我们想要尽可能利用数据集中所有可用的变量。
本练习是课程的一部分
用 R 进行市场营销分析的机器学习
练习说明
- 计算一个完整模型
salesModel1,使用除id外的所有变量来解释本月销售额。为此,请将正确的变量名填入以下占位语法:response ~ . - excluded_variable。其含义是:"用除excluded_variable之外的所有变量来拟合response"。 - 使用
rms包中的vif()函数估计方差膨胀因子。 - 在排除变量
id的基础上,再去除preferredBrand和nBrands,以避免多重共线性。方法是为每个要去除的变量追加一个-。将该模型保存为salesModel2。 - 重新估计该模型的方差膨胀因子。现在您会接受这些结果吗?
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Estimating the full model
salesModel1 <- lm(salesThisMon ~ . - ___,
data = salesData)
# Checking variance inflation factors
vif(___)
# Estimating new model by removing information on brand
salesModel2 <- lm(salesThisMon ~ . - ___,
data = ___)
# Checking variance inflation factors
___