Анализ важности переменных
Набор данных attrition содержит 839 наблюдений и 30 предикторов для целевой переменной «Attrition». Вас интересует компромисс между производительностью модели, использующей все доступные предикторы, и сокращённой моделью на основе нескольких информативных переменных.
В этом упражнении вы обучите модель и изучите важность переменных в полученной модели. В следующем упражнении вы сравните производительность этой модели с производительностью сокращённой модели.
В вашей среде доступны разбивки train и test, пакет vip(), а также заранее объявленная логистическая регрессия model.
Это упражнение является частью курса
Конструирование признаков в R
Инструкции к упражнению
- Создайте рецепт, моделирующий
Attritionс использованием всех предикторов. - Обучите рабочий процесс на обучающих данных.
- Используйте объект
fit_full, чтобы построить график важности признаков модели. - Перед вызовом
vip()примените функциюextract_fit_parsnip(), чтобы передать ей необходимую информацию.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a recipe that models Attrition using all the predictors
recipe_full <- ___(___, data = train)
workflow_full <- workflow() %>%
add_model(model) %>%
add_recipe(recipe_full)
# Fit the workflow to the training data
fit_full <- ___ %>%
___(data = train)
# Use the fit_full object to graph the variable importance of your model. Apply extract_fit_parsnip() function before vip()
fit_full %>% ___() %>%
___(aesthetics = list(fill = "steelblue"))