Créer un modèle de forêt aléatoire
Ici, vous allez utiliser les mêmes données de validation croisée pour construire (avec train) et évaluer (avec validate) des forêts aléatoires pour chaque partition. Comme vous utilisez les mêmes partitions de validation croisée que vos modèles de régression, vous pouvez comparer directement la performance des deux modèles.
Remarque : Nous limiterons nos forêts aléatoires à 100 arbres afin qu'elles s'ajustent en un temps raisonnable. Le nombre d'arbres par défaut pour ranger() est 500.
Cette activité fait partie du cours
Machine Learning dans le tidyverse
Instructions de l’exercice
- Utilisez
ranger()pour construire une forêt aléatoire qui préditlife_expectancyà l'aide de toutes les caractéristiques detrainpour chaque partition de validation croisée. - Ajoutez une nouvelle colonne
validate_predictedqui préditlife_expectancypour les observations dansvalidateà l'aide des modèles de forêt aléatoire que vous venez de créer.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))