Použití PCA jako alternativy k nearZeroVar()
Alternativou k odstraňování prediktorů s nízkou variancí je spustit na svých datech PCA. Tento přístup je někdy výhodnější, protože nepřichází o všechna data: mnoho různých prediktorů s nízkou variancí může být sloučeno do jediné PCA proměnné s vysokou variancí, což může mít pozitivní vliv na přesnost modelu.
Obzvlášť užitečný je tento trik u lineárních modelů: možnost pca v argumentu preProcess data vycentruje a škáluje, sloučí proměnné s nízkou variancí a zajistí, že všechny prediktory budou ortogonální. Výsledkem je ideální dataset pro lineární regresní modelování, který dokáže přesnost modelů výrazně zlepšit.
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Pokyny k cvičení
bloodbrain_x a bloodbrain_y jsou načteny v tvém pracovním prostředí.
- Natrénuj model
glmna celém datasetu blood-brain s použitím možnosti"pca"v argumentupreProcess. - Vypiš model do konzole a prohlédni si výsledek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit glm model using PCA: model
model <- train(
x = ___,
y = ___,
method = ___,
preProcess = ___
)
# Print model to console