Використання PCA як альтернативи nearZeroVar()
Альтернатива вилученню предикторів із низькою дисперсією — виконати PCA для вашого набору даних. Інколи це краще, адже ви не відкидаєте всі дані: багато різних предикторів із низькою дисперсією можуть бути об'єднані в одну змінну PCA з високою дисперсією, що може позитивно вплинути на точність моделі.
Це особливо корисний прийом для лінійних моделей: параметр pca в аргументі preProcess виконає центровання та масштабування даних, об'єднає змінні з низькою дисперсією та гарантує ортогональність усіх предикторів. Це створює ідеальний набір даних для моделювання лінійної регресії й часто підвищує точність моделей.
Ця вправа є частиною курсу
Machine Learning з пакетом caret в R
Інструкції до вправи
bloodbrain_x і bloodbrain_y завантажено у ваш робочий простір.
- Навчіть модель
glmна повному наборі даних blood-brain, використовуючи опцію"pca"уpreProcess. - Виведіть модель у консоль і перегляньте результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Fit glm model using PCA: model
model <- train(
x = ___,
y = ___,
method = ___,
preProcess = ___
)
# Print model to console