使用主成分的线性回归
对象 newsData 现在包含一个额外的变量:logShares。该变量表示新闻文章被分享的次数。由于这个分布会高度偏态,因此您将使用分享次数的对数来建模。请应用刚学到的方法,预测对数分享量!
本练习是课程的一部分
用 R 进行市场营销分析的机器学习
练习说明
- 使用除对数分享量外的所有变量来拟合一个预测模型,并将其保存为
mod1。 - 创建一个新的数据框
dataNewsComponents,其中包含对数分享量以及前 6 个主成分的取值。对象pcaNews仍然包含 PCA 的结果。 - 拟合第二个模型(
mod2),仅使用这 6 个主成分来预测对数分享量。 - 比较两个模型的调整后 R 平方。只使用主成分后,该数值如何变化?模型效果如何?
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Predict log shares with all original variables
mod1 <- lm(logShares ~ ., data = ___)
# Create dataframe with log shares and first 6 components
dataNewsComponents <- cbind(logShares = newsData[, "logShares"],
___$x[, 1:__]) %>%
as.data.frame()
# Predict log shares with first six components
mod2 <- lm(___ ~ ., data = ___)
# Print adjusted R squared for both models
___(mod1)$adj.r.squared
summary(___)$___