Construire un modèle de random forest
Ici, vous allez utiliser les mêmes données de validation croisée pour entraîner (avec train) et évaluer (avec validate) des random forests pour chaque partition. Comme vous utilisez les mêmes partitions de validation croisée que vos modèles de régression, vous pouvez comparer directement les performances des deux modèles.
Remarque : Nous limiterons nos random forests à 100 arbres pour garantir un temps d’entraînement raisonnable. Le nombre d’arbres par défaut de ranger() est 500.
Cet exercice fait partie du cours
<cours>Machine Learning dans le tidyverse</cours>Instructions de l’exercice
- Utilisez
ranger()pour construire une random forest prédisantlife_expectancyà partir de toutes les variables detrainpour chaque partition de validation croisée. - Ajoutez une nouvelle colonne
validate_predictedcontenant la prédiction delife_expectancypour les observations devalidateen utilisant les modèles de random forest que vous venez de créer.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))