CommencezCommencez gratuitement

Créer un modèle de forêt aléatoire

Ici, vous allez utiliser les mêmes données de validation croisée pour construire (avec train) et évaluer (avec validate) des forêts aléatoires pour chaque partition. Comme vous utilisez les mêmes partitions de validation croisée que vos modèles de régression, vous pouvez comparer directement la performance des deux modèles.

Remarque : Nous limiterons nos forêts aléatoires à 100 arbres afin qu'elles s'ajustent en un temps raisonnable. Le nombre d'arbres par défaut pour ranger() est 500.

Cette activité fait partie du cours

Machine Learning dans le tidyverse

Voir le cours

Instructions de l’exercice

  • Utilisez ranger() pour construire une forêt aléatoire qui prédit life_expectancy à l'aide de toutes les caractéristiques de train pour chaque partition de validation croisée.
  • Ajoutez une nouvelle colonne validate_predicted qui prédit life_expectancy pour les observations dans validate à l'aide des modèles de forêt aléatoire que vous venez de créer.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(ranger)

# Build a random forest model for each fold
cv_models_rf <- cv_data %>% 
  mutate(model = map(___, ~ranger(formula = ___, data = ___,
                                    num.trees = 100, seed = 42)))

# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>% 
  mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))
Modifier et exécuter le code