Zacznij terazZacznij za darmo

Użycie PCA jako alternatywy dla nearZeroVar()

Alternatywą dla usuwania predyktorów o niskiej wariancji jest zastosowanie PCA na zbiorze danych. Takie podejście bywa lepszym wyborem, ponieważ nie odrzuca wszystkich danych: wiele predyktorów o niskiej wariancji może zostać połączonych w jedną zmienną PCA o wysokiej wariancji, co może pozytywnie wpłynąć na dokładność modelu.

To szczególnie przydatna technika w przypadku modeli liniowych: opcja pca w argumencie preProcess wycentruje i przeskaluje dane, połączy zmienne o niskiej wariancji oraz zagwarantuje, że wszystkie predyktory będą ortogonalne. Dzięki temu powstaje idealny zbiór danych do regresji liniowej, który często poprawia dokładność modeli.

To ćwiczenie jest częścią kursu

Uczenie maszynowe z caret w R

Zobacz kurs

Instrukcje do ćwiczenia

bloodbrain_x i bloodbrain_y są wczytane do twojego środowiska pracy.

  • Dopasuj model glm do pełnego zbioru danych blood-brain, używając opcji "pca" w argumencie preProcess.
  • Wyświetl model w konsoli i przejrzyj wyniki.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Fit glm model using PCA: model
model <- train(
  x = ___, 
  y = ___,
  method = ___, 
  preProcess = ___
)

# Print model to console
Edytuj i uruchom kod