Začněte nyníZačněte zdarma

Kombinování metod předzpracování

Argument preProcess funkce train() není omezený jen na imputaci chybějících hodnot. Nabízí celou řadu dalších technik předzpracování, které ti jako datovému vědci/vědkyni výrazně usnadní práci. Celý seznam najdeš zadáním ?preProcess do konzole – otevře se ti stránka nápovědy k této funkci.

Jednou z obzvláště užitečných skupin funkcí předzpracování pro regresní modely je standardizace: centrování a škálování. Nejdřív provedeme centrování – od každé hodnoty ve sloupci odečteme průměr daného sloupce. Pak přistoupíme ke škálování – každou hodnotu vydělíme směrodatnou odchylkou.

Standardizace transformuje data tak, že u každého sloupce bude průměr roven 0 a směrodatná odchylka 1. Regresním modelům to výrazně usnadní nalezení dobrého řešení.

Toto cvičení je součástí kurzu

Machine Learning s balíčkem caret v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Fit glm with median imputation
model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print model
Upravit a spustit kód