Začněte nyníZačněte zdarma

Lineární regrese s hlavními komponentami

Objekt newsData nyní obsahuje dodatečnou proměnnou: logShares. Počet sdílení říká, jak často byly zpravodajské články sdíleny. Toto rozdělení by však bylo silně zešikmené, takže budeš pracovat s logaritmem počtu sdílení. Využij to, co ses právě naučil/a, a proveď predikci logaritmu sdílení!

Toto cvičení je součástí kurzu

Machine Learning for Marketing Analytics in R

Zobrazit kurz

Pokyny k cvičení

  • Sestav model pro predikci logaritmu sdílení pomocí všech ostatních proměnných. Ulož ho jako mod1.
  • Vytvoř nový dataframe dataNewsComponents s logaritmem sdílení a hodnotami na prvních 6 komponentách. Objekt pcaNews opět obsahuje výsledky PCA.
  • Sestav druhý model (mod2), který predikuje logaritmus sdílení pomocí pouze 6 komponent.
  • Porovnej upravené R² obou modelů. Jak se hodnota změnila při použití pouze hlavních komponent? Jak dobrý je tvůj model?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Predict log shares with all original variables
mod1 <- lm(logShares ~ ., data = ___)

# Create dataframe with log shares and first 6 components
dataNewsComponents <- cbind(logShares = newsData[, "logShares"],
                            ___$x[, 1:__]) %>%
  as.data.frame()

# Predict log shares with first six components
mod2 <- lm(___ ~ ., data = ___)

# Print adjusted R squared for both models
___(mod1)$adj.r.squared
summary(___)$___
Upravit a spustit kód