CommencezCommencez gratuitement

Créer un modèle de forêt aléatoire complet

Les modèles de forêt aléatoire effectuent naturellement une sélection de variables en construisant de nombreux sous-arbres à partir de sous-ensembles aléatoires des caractéristiques. Une façon de comprendre l'importance des variables est de construire un modèle, puis d'extraire ces importances. Dans cet exercice, vous utiliserez les données Healthcare Job Attrition pour entraîner un modèle de classification rand_forest() à partir duquel vous pourrez extraire l'importance des variables. Pour rendre ces importances disponibles, assurez-vous de créer le modèle avec importance = "impurity". Les ensembles train et test sont à votre disposition.

Les plugiciels tidyverse, tidymodels et vip ont été chargés pour vous.

Cette activité fait partie du cours

Réduction de dimension en R

Voir le cours

Instructions de l’exercice

  • Définissez un modèle de forêt aléatoire de classification avec 200 arbres, que vous pourrez utiliser pour extraire l'importance des variables.
  • Ajustez le modèle de forêt aléatoire avec tous les prédicteurs.
  • Joignez les prédictions à l'ensemble de test.
  • Calculez la métrique F1.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>% 
  set_engine("___", ___ = "___") 

# Fit the random forest model with all predictors
rf_fit <- ___ %>% 
  ___(___, data = ___)

# Create the test set prediction data frame
predict_df <- ___ %>% 
  bind_cols(predict = ___(___, ___))

# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)
Modifier et exécuter le code