ÎncepețiÎncepe gratuit

Combinarea metodelor de preprocesare

Argumentul preProcess al funcției train() nu se limitează doar la imputarea valorilor lipsă. Include și o gamă largă de alte tehnici de preprocesare care îți pot simplifica mult munca de om de știință al datelor. Poți consulta lista completă tastând ?preProcess și citind pagina de ajutor a acestei funcții.

O categorie de funcții de preprocesare deosebit de utilă pentru modelele de regresie este standardizarea: centrarea și scalarea. Mai întâi centrezi scăzând media fiecărei coloane din valorile acelei coloane, apoi scalezi împărțind la deviația standard.

Standardizarea transformă datele astfel încât, pentru fiecare coloană, media devine 0, iar deviația standard devine 1. Aceasta îi permite modelului de regresie să găsească mai ușor o soluție bună.

Acest exercițiu face parte din cursul

Machine Learning cu caret în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Fit glm with median imputation
model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print model
Editează și rulează codul