Użycie PCA jako alternatywy dla nearZeroVar()
Alternatywą dla usuwania predyktorów o niskiej wariancji jest zastosowanie PCA na zbiorze danych. Takie podejście bywa lepszym wyborem, ponieważ nie odrzuca wszystkich danych: wiele predyktorów o niskiej wariancji może zostać połączonych w jedną zmienną PCA o wysokiej wariancji, co może pozytywnie wpłynąć na dokładność modelu.
To szczególnie przydatna technika w przypadku modeli liniowych: opcja pca w argumencie preProcess wycentruje i przeskaluje dane, połączy zmienne o niskiej wariancji oraz zagwarantuje, że wszystkie predyktory będą ortogonalne. Dzięki temu powstaje idealny zbiór danych do regresji liniowej, który często poprawia dokładność modeli.
To ćwiczenie jest częścią kursu
Uczenie maszynowe z caret w R
Instrukcje do ćwiczenia
bloodbrain_x i bloodbrain_y są wczytane do twojego środowiska pracy.
- Dopasuj model
glmdo pełnego zbioru danych blood-brain, używając opcji"pca"w argumenciepreProcess. - Wyświetl model w konsoli i przejrzyj wyniki.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Fit glm model using PCA: model
model <- train(
x = ___,
y = ___,
method = ___,
preProcess = ___
)
# Print model to console