Passer au crible l'importance des variables
Le jeu de données attrition contient 839 observations et 30 prédicteurs pour « Attrition ». Vous souhaitez explorer le compromis entre la performance d'un modèle qui utilise tous les prédicteurs disponibles et celle d'un modèle réduit basé sur quelques variables informatives.
Dans cet exercice, vous allez ajuster un modèle et examiner l'importance des variables de ce modèle ajusté. Dans l'exercice suivant, vous évaluerez la performance de ce modèle comparativement à un modèle réduit.
Les divisions train et test ainsi que le paquet vip() sont disponibles dans votre environnement, de même qu'un modèle de régression logistique model déjà défini.
Cette activité fait partie du cours
Ingénierie des caractéristiques en R
Instructions de l’exercice
- Créez une recette qui modélise
Attritionà l'aide de tous les prédicteurs. - Ajustez le flux de travail sur les données d'entraînement.
- Utilisez l'objet
fit_fullpour tracer l'importance des variables de votre modèle. - Appliquez la fonction
extract_fit_parsnip()avantvip()pour lui fournir l'information requise.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a recipe that models Attrition using all the predictors
recipe_full <- ___(___, data = train)
workflow_full <- workflow() %>%
add_model(model) %>%
add_recipe(recipe_full)
# Fit the workflow to the training data
fit_full <- ___ %>%
___(data = train)
# Use the fit_full object to graph the variable importance of your model. Apply extract_fit_parsnip() function before vip()
fit_full %>% ___() %>%
___(aesthetics = list(fill = "steelblue"))