ПочатиПочніть безкоштовно

Використання PCA як альтернативи nearZeroVar()

Альтернатива вилученню предикторів із низькою дисперсією — виконати PCA для вашого набору даних. Інколи це краще, адже ви не відкидаєте всі дані: багато різних предикторів із низькою дисперсією можуть бути об'єднані в одну змінну PCA з високою дисперсією, що може позитивно вплинути на точність моделі.

Це особливо корисний прийом для лінійних моделей: параметр pca в аргументі preProcess виконає центровання та масштабування даних, об'єднає змінні з низькою дисперсією та гарантує ортогональність усіх предикторів. Це створює ідеальний набір даних для моделювання лінійної регресії й часто підвищує точність моделей.

Ця вправа є частиною курсу

Machine Learning з пакетом caret в R

Переглянути курс

Інструкції до вправи

bloodbrain_x і bloodbrain_y завантажено у ваш робочий простір.

  • Навчіть модель glm на повному наборі даних blood-brain, використовуючи опцію "pca" у preProcess.
  • Виведіть модель у консоль і перегляньте результат.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Fit glm model using PCA: model
model <- train(
  x = ___, 
  y = ___,
  method = ___, 
  preProcess = ___
)

# Print model to console
Редагувати та запускати код