CommencezCommencez gratuitement

Passer au crible l'importance des variables

Le jeu de données attrition contient 839 observations et 30 prédicteurs pour « Attrition ». Vous souhaitez explorer le compromis entre la performance d'un modèle qui utilise tous les prédicteurs disponibles et celle d'un modèle réduit basé sur quelques variables informatives.

Dans cet exercice, vous allez ajuster un modèle et examiner l'importance des variables de ce modèle ajusté. Dans l'exercice suivant, vous évaluerez la performance de ce modèle comparativement à un modèle réduit.

Les divisions train et test ainsi que le paquet vip() sont disponibles dans votre environnement, de même qu'un modèle de régression logistique model déjà défini.

Cette activité fait partie du cours

Ingénierie des caractéristiques en R

Voir le cours

Instructions de l’exercice

  • Créez une recette qui modélise Attrition à l'aide de tous les prédicteurs.
  • Ajustez le flux de travail sur les données d'entraînement.
  • Utilisez l'objet fit_full pour tracer l'importance des variables de votre modèle.
  • Appliquez la fonction extract_fit_parsnip() avant vip() pour lui fournir l'information requise.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a recipe that models Attrition using all the predictors
recipe_full <- ___(___, data = train)

workflow_full <- workflow() %>%
  add_model(model) %>%
  add_recipe(recipe_full)

# Fit the workflow to the training data
fit_full <- ___ %>%
  ___(data = train)

# Use the fit_full object to graph the variable importance of your model. Apply extract_fit_parsnip() function before vip()
fit_full %>% ___() %>%
  ___(aesthetics = list(fill = "steelblue"))
Modifier et exécuter le code