Importance des variables
Vous savez déjà que les arbres ensachés (bagging) forment un modèle d'ensemble qui corrige le problème de variance des arbres de décision. Vous avez maintenant appris que l'algorithme de forêt aléatoire améliore encore les choses en utilisant seulement un sous-ensemble aléatoire des caractéristiques dans chaque arbre. Cela réduit davantage la corrélation entre les arbres de l'ensemble et améliore la performance prédictive.
Dans cet exercice, vous allez construire vous-même une forêt aléatoire et tracer l'importance des prédicteurs à l'aide du paquet vip. Les données d'entraînement, customers_train, sont déjà chargées dans votre espace de travail.
Cette activité fait partie du cours
Machine Learning avec des modèles arborescents en R
Instructions de l’exercice
- Créez
spec, la spécification d'un modèle de classification par forêt aléatoire en utilisant le moteur"ranger"et l'importance des variables basée sur"impurity". - Créez
modelen ajustant le tibblecustomers_trainàspec, avecstill_customercomme variable cible et toutes les autres colonnes comme variables prédictives. - Tracez l'importance des variables à l'aide de la fonction
vip()du paquetvip(qui n'est pas préchargé).
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)