Lineární regrese s hlavními komponentami
Objekt newsData nyní obsahuje dodatečnou proměnnou: logShares. Počet sdílení říká, jak často byly zpravodajské články sdíleny. Toto rozdělení by však bylo silně zešikmené, takže budeš pracovat s logaritmem počtu sdílení. Využij to, co ses právě naučil/a, a proveď predikci logaritmu sdílení!
Toto cvičení je součástí kurzu
Machine Learning for Marketing Analytics in R
Pokyny k cvičení
- Sestav model pro predikci logaritmu sdílení pomocí všech ostatních proměnných. Ulož ho jako
mod1. - Vytvoř nový dataframe
dataNewsComponentss logaritmem sdílení a hodnotami na prvních 6 komponentách. ObjektpcaNewsopět obsahuje výsledky PCA. - Sestav druhý model (
mod2), který predikuje logaritmus sdílení pomocí pouze 6 komponent. - Porovnej upravené R² obou modelů. Jak se hodnota změnila při použití pouze hlavních komponent? Jak dobrý je tvůj model?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Predict log shares with all original variables
mod1 <- lm(logShares ~ ., data = ___)
# Create dataframe with log shares and first 6 components
dataNewsComponents <- cbind(logShares = newsData[, "logShares"],
___$x[, 1:__]) %>%
as.data.frame()
# Predict log shares with first six components
mod2 <- lm(___ ~ ., data = ___)
# Print adjusted R squared for both models
___(mod1)$adj.r.squared
summary(___)$___