Folosirea PCA ca alternativă la nearZeroVar()
O alternativă la eliminarea predictorilor cu varianță scăzută este aplicarea PCA pe setul tău de date. Uneori această abordare este preferabilă, deoarece nu elimină toate datele: mai mulți predictori cu varianță scăzută pot fi combinați într-o singură variabilă PCA cu varianță ridicată, ceea ce poate îmbunătăți acuratețea modelului tău.
Acesta este un truc deosebit de util pentru modelele liniare: opțiunea pca din argumentul preProcess va centra și scala datele tale, va combina variabilele cu varianță scăzută și va garanta că toți predictorii sunt ortogonali. Rezultatul este un set de date ideal pentru modelarea prin regresie liniară și poate îmbunătăți semnificativ performanța modelelor tale.
Acest exercițiu face parte din cursul
Machine Learning cu caret în R
Instrucțiuni pentru exercițiu
bloodbrain_x și bloodbrain_y sunt încărcate în spațiul tău de lucru.
- Antrenează un model
glmpe întregul set de date blood-brain, folosind opțiunea"pca"pentrupreProcess. - Afișează modelul în consolă și inspectează rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fit glm model using PCA: model
model <- train(
x = ___,
y = ___,
method = ___,
preProcess = ___
)
# Print model to console