Combinarea metodelor de preprocesare
Argumentul preProcess al funcției train() nu se limitează doar la imputarea valorilor lipsă. Include și o gamă largă de alte tehnici de preprocesare care îți pot simplifica mult munca de om de știință al datelor. Poți consulta lista completă tastând ?preProcess și citind pagina de ajutor a acestei funcții.
O categorie de funcții de preprocesare deosebit de utilă pentru modelele de regresie este standardizarea: centrarea și scalarea. Mai întâi centrezi scăzând media fiecărei coloane din valorile acelei coloane, apoi scalezi împărțind la deviația standard.
Standardizarea transformă datele astfel încât, pentru fiecare coloană, media devine 0, iar deviația standard devine 1. Aceasta îi permite modelului de regresie să găsească mai ușor o soluție bună.
Acest exercițiu face parte din cursul
Machine Learning cu caret în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model