Använda PCA som alternativ till nearZeroVar()
Ett alternativ till att ta bort prediktorer med låg varians är att köra PCA på din datamängd. Det kan ibland vara att föredra, eftersom det inte slänger bort all data: många olika prediktorer med låg varians kan slås samman till en enda PCA-variabel med hög varians, vilket kan förbättra modellens noggrannhet.
Detta är ett särskilt bra knep för linjära modeller: alternativet pca i argumentet preProcess centrerar och skalar dina data, kombinerar variabler med låg varians och säkerställer att alla prediktorer är ortogonala. Det ger ett idealiskt dataset för linjär regressionsmodellering och kan ofta förbättra modellens noggrannhet.
Den här övningen är en del av kursen
Maskininlärning med caret i R
Övningsinstruktioner
bloodbrain_x och bloodbrain_y är inlästa i din miljö.
- Anpassa en
glm-modell till hela blod-hjärnbarriär-datamängden med alternativet"pca"ipreProcess. - Skriv ut modellen i konsolen och granska resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Fit glm model using PCA: model
model <- train(
x = ___,
y = ___,
method = ___,
preProcess = ___
)
# Print model to console