Combiner des méthodes de prétraitement
L'argument preProcess de train() ne se limite pas à l'imputation des valeurs manquantes. Il comprend aussi une grande variété d'autres techniques de preProcess qui vous simplifient grandement la vie comme scientiste des données. Vous pouvez consulter la liste complète en tapant ?preProcess et en lisant la page d'aide de cette fonction.
Un ensemble de fonctions de prétraitement particulièrement utiles pour ajuster des modèles de régression est la normalisation : centrage et mise à l'échelle. Vous commencez par centrer en soustrayant la moyenne de chaque colonne à chacune de ses valeurs, puis vous mettez à l'échelle en divisant par l'écart-type.
La normalisation transforme vos données de sorte que, pour chaque colonne, la moyenne est 0 et l'écart-type est 1. Cela facilite la recherche d'une bonne solution par les modèles de régression.
Cette activité fait partie du cours
Machine Learning avec caret en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model