Kombinování metod předzpracování
Argument preProcess funkce train() není omezený jen na imputaci chybějících hodnot. Nabízí celou řadu dalších technik předzpracování, které ti jako datovému vědci/vědkyni výrazně usnadní práci. Celý seznam najdeš zadáním ?preProcess do konzole – otevře se ti stránka nápovědy k této funkci.
Jednou z obzvláště užitečných skupin funkcí předzpracování pro regresní modely je standardizace: centrování a škálování. Nejdřív provedeme centrování – od každé hodnoty ve sloupci odečteme průměr daného sloupce. Pak přistoupíme ke škálování – každou hodnotu vydělíme směrodatnou odchylkou.
Standardizace transformuje data tak, že u každého sloupce bude průměr roven 0 a směrodatná odchylka 1. Regresním modelům to výrazně usnadní nalezení dobrého řešení.
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model