Ajuster une random forest
Comme vous l'avez vu dans la vidéo, les modèles de random forest sont beaucoup plus flexibles que les modèles linéaires ; ils peuvent modéliser des effets non linéaires complexes et capturer automatiquement les interactions entre variables. Ils donnent souvent d'excellents résultats sur des données réelles. Essayons-en un sur l'ensemble de données sur la qualité du vin, où l'objectif est de prédire la qualité évaluée par des humains d'un lot de vin, à partir de certaines propriétés chimiques et physiques mesurées par machine pour ce lot.
Ajuster un modèle de random forest se fait exactement de la même façon que pour une régression linéaire généralisée, comme vous l'avez fait au chapitre précédent. Il suffit de définir l'argument method de la fonction train à "ranger". Le paquet ranger est une réécriture du classique randomForest de R ; il ajuste les modèles beaucoup plus rapidement, tout en donnant pratiquement les mêmes résultats. Nous recommandons à tous les débutants d'utiliser le paquet ranger pour la modélisation par random forest.
Cette activité fait partie du cours
Machine Learning avec caret en R
Instructions de l’exercice
- Entraînez une random forest nommée
modelsur l'ensemble de donnéeswine, oùqualityest la variable réponse et toutes les autres variables sont explicatives. - Utilisez
method = "ranger". - Utilisez un
tuneLengthde 1. - Utilisez 5 plis de CV.
- Affichez
modeldans la console.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Fit random forest: model
model <- train(
___,
tuneLength = ___,
data = ___,
method = ___,
trControl = trainControl(
method = "cv",
number = ___,
verboseIter = TRUE
)
)
# Print model to console