CommencezCommencez gratuitement

Ajuster une random forest

Comme vous l'avez vu dans la vidéo, les modèles de random forest sont beaucoup plus flexibles que les modèles linéaires ; ils peuvent modéliser des effets non linéaires complexes et capturer automatiquement les interactions entre variables. Ils donnent souvent d'excellents résultats sur des données réelles. Essayons-en un sur l'ensemble de données sur la qualité du vin, où l'objectif est de prédire la qualité évaluée par des humains d'un lot de vin, à partir de certaines propriétés chimiques et physiques mesurées par machine pour ce lot.

Ajuster un modèle de random forest se fait exactement de la même façon que pour une régression linéaire généralisée, comme vous l'avez fait au chapitre précédent. Il suffit de définir l'argument method de la fonction train à "ranger". Le paquet ranger est une réécriture du classique randomForest de R ; il ajuste les modèles beaucoup plus rapidement, tout en donnant pratiquement les mêmes résultats. Nous recommandons à tous les débutants d'utiliser le paquet ranger pour la modélisation par random forest.

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Instructions de l’exercice

  • Entraînez une random forest nommée model sur l'ensemble de données wine, où quality est la variable réponse et toutes les autres variables sont explicatives.
  • Utilisez method = "ranger".
  • Utilisez un tuneLength de 1.
  • Utilisez 5 plis de CV.
  • Affichez model dans la console.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Fit random forest: model
model <- train(
  ___,
  tuneLength = ___,
  data = ___, 
  method = ___,
  trControl = trainControl(
    method = "cv", 
    number = ___, 
    verboseIter = TRUE
  )
)

# Print model to console
Modifier et exécuter le code