开始使用免费开始使用

使用主成分的线性回归

对象 newsData 现在包含一个额外的变量:logShares。该变量表示新闻文章被分享的次数。由于这个分布会高度偏态,因此您将使用分享次数的对数来建模。请应用刚学到的方法,预测对数分享量!

本练习是课程的一部分

用 R 进行市场营销分析的机器学习

查看课程

练习说明

  • 使用除对数分享量外的所有变量来拟合一个预测模型,并将其保存为 mod1
  • 创建一个新的数据框 dataNewsComponents,其中包含对数分享量以及前 6 个主成分的取值。对象 pcaNews 仍然包含 PCA 的结果。
  • 拟合第二个模型(mod2),仅使用这 6 个主成分来预测对数分享量。
  • 比较两个模型的调整后 R 平方。只使用主成分后,该数值如何变化?模型效果如何?

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Predict log shares with all original variables
mod1 <- lm(logShares ~ ., data = ___)

# Create dataframe with log shares and first 6 components
dataNewsComponents <- cbind(logShares = newsData[, "logShares"],
                            ___$x[, 1:__]) %>%
  as.data.frame()

# Predict log shares with first six components
mod2 <- lm(___ ~ ., data = ___)

# Print adjusted R squared for both models
___(mod1)$adj.r.squared
summary(___)$___
编辑并运行代码