Začněte nyníZačněte zdarma

Použití PCA jako alternativy k nearZeroVar()

Alternativou k odstraňování prediktorů s nízkou variancí je spustit na svých datech PCA. Tento přístup je někdy výhodnější, protože nepřichází o všechna data: mnoho různých prediktorů s nízkou variancí může být sloučeno do jediné PCA proměnné s vysokou variancí, což může mít pozitivní vliv na přesnost modelu.

Obzvlášť užitečný je tento trik u lineárních modelů: možnost pca v argumentu preProcess data vycentruje a škáluje, sloučí proměnné s nízkou variancí a zajistí, že všechny prediktory budou ortogonální. Výsledkem je ideální dataset pro lineární regresní modelování, který dokáže přesnost modelů výrazně zlepšit.

Toto cvičení je součástí kurzu

Machine Learning s balíčkem caret v R

Zobrazit kurz

Pokyny k cvičení

bloodbrain_x a bloodbrain_y jsou načteny v tvém pracovním prostředí.

  • Natrénuj model glm na celém datasetu blood-brain s použitím možnosti "pca" v argumentu preProcess.
  • Vypiš model do konzole a prohlédni si výsledek.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Fit glm model using PCA: model
model <- train(
  x = ___, 
  y = ___,
  method = ___, 
  preProcess = ___
)

# Print model to console
Upravit a spustit kód