CommencezCommencez gratuitement

Importance des variables

Vous savez déjà que les arbres ensachés (bagging) forment un modèle d'ensemble qui corrige le problème de variance des arbres de décision. Vous avez maintenant appris que l'algorithme de forêt aléatoire améliore encore les choses en utilisant seulement un sous-ensemble aléatoire des caractéristiques dans chaque arbre. Cela réduit davantage la corrélation entre les arbres de l'ensemble et améliore la performance prédictive.

Dans cet exercice, vous allez construire vous-même une forêt aléatoire et tracer l'importance des prédicteurs à l'aide du paquet vip. Les données d'entraînement, customers_train, sont déjà chargées dans votre espace de travail.

Cette activité fait partie du cours

Machine Learning avec des modèles arborescents en R

Voir le cours

Instructions de l’exercice

  • Créez spec, la spécification d'un modèle de classification par forêt aléatoire en utilisant le moteur "ranger" et l'importance des variables basée sur "impurity".
  • Créez model en ajustant le tibble customers_train à spec, avec still_customer comme variable cible et toutes les autres colonnes comme variables prédictives.
  • Tracez l'importance des variables à l'aide de la fonction vip() du paquet vip (qui n'est pas préchargé).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Specify a random forest
spec <- ___ %>%
	set_mode("classification") %>%
    set_engine(___, importance = ___)

# Train the forest
model <- spec %>%
    fit(___,
        ___)

# Plot the variable importance
vip::___(model)
Modifier et exécuter le code