Поєднання методів попередньої обробки
Аргумент preProcess у train() не обмежує вас лише імпутацією пропущених значень. Він також охоплює широкий набір інших прийомів preProcess, які значно полегшують роботу дата-сайєнтиста. Повний перелік можна переглянути, ввівши ?preProcess і прочитавши довідку до цієї функції.
Окремий набір корисних для регресійних моделей методів попередньої обробки — це стандартизація: центрування та масштабування. Спочатку ви виконуєте центрування, віднімаючи від кожного значення в стовпці середнє цього стовпця, потім виконуєте масштабування, ділячи на стандартне відхилення.
Стандартизація перетворює дані так, що для кожного стовпця середнє дорівнює 0, а стандартне відхилення — 1. Це полегшує регресійним моделям пошук якісного розв'язку.
Ця вправа є частиною курсу
Machine Learning з пакетом caret в R
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model