Łączenie metod preprocessingu
Argument preProcess funkcji train() nie ogranicza się wyłącznie do uzupełniania brakujących wartości. Oferuje również wiele innych technik preprocessingu, które znacznie ułatwiają pracę w roli analityka danych. Pełną listę dostępnych metod znajdziesz, wpisując ?preProcess i przeglądając stronę pomocy tej funkcji.
Szczególnie przydatnym zestawem funkcji preprocessingu przy dopasowywaniu modeli regresji jest standaryzacja: centrowanie i skalowanie. Najpierw centrujesz dane – odejmujesz średnią każdej kolumny od każdej wartości w tej kolumnie, a następnie skolujesz – dzielisz przez odchylenie standardowe.
Standaryzacja przekształca dane tak, że dla każdej kolumny średnia wynosi 0, a odchylenie standardowe 1. Dzięki temu modele regresji łatwiej znajdują dobre rozwiązanie.
To ćwiczenie jest częścią kursu
Uczenie maszynowe z caret w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model