ПочатиПочніть безкоштовно

Поєднання методів попередньої обробки

Аргумент preProcess у train() не обмежує вас лише імпутацією пропущених значень. Він також охоплює широкий набір інших прийомів preProcess, які значно полегшують роботу дата-сайєнтиста. Повний перелік можна переглянути, ввівши ?preProcess і прочитавши довідку до цієї функції.

Окремий набір корисних для регресійних моделей методів попередньої обробки — це стандартизація: центрування та масштабування. Спочатку ви виконуєте центрування, віднімаючи від кожного значення в стовпці середнє цього стовпця, потім виконуєте масштабування, ділячи на стандартне відхилення.

Стандартизація перетворює дані так, що для кожного стовпця середнє дорівнює 0, а стандартне відхилення — 1. Це полегшує регресійним моделям пошук якісного розв'язку.

Ця вправа є частиною курсу

Machine Learning з пакетом caret в R

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Fit glm with median imputation
model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print model
Редагувати та запускати код