CommencerCommencez gratuitement

Construire un modèle de random forest

Ici, vous allez utiliser les mêmes données de validation croisée pour entraîner (avec train) et évaluer (avec validate) des random forests pour chaque partition. Comme vous utilisez les mêmes partitions de validation croisée que vos modèles de régression, vous pouvez comparer directement les performances des deux modèles.

Remarque : Nous limiterons nos random forests à 100 arbres pour garantir un temps d’entraînement raisonnable. Le nombre d’arbres par défaut de ranger() est 500.

Cet exercice fait partie du cours

<cours>Machine Learning dans le tidyverse</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez ranger() pour construire une random forest prédisant life_expectancy à partir de toutes les variables de train pour chaque partition de validation croisée.
  • Ajoutez une nouvelle colonne validate_predicted contenant la prédiction de life_expectancy pour les observations de validate en utilisant les modèles de random forest que vous venez de créer.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(ranger)

# Build a random forest model for each fold
cv_models_rf <- cv_data %>% 
  mutate(model = map(___, ~ranger(formula = ___, data = ___,
                                    num.trees = 100, seed = 42)))

# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>% 
  mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))
Modifier et exécuter le code