Построение полной модели случайного леса
Модели случайного леса по своей природе выполняют отбор признаков: при построении множества поддеревьев они каждый раз работают со случайными подмножествами признаков. Один из способов оценить важность признаков — обучить модель и извлечь соответствующие значения. В этом упражнении вы используете набор данных об увольнениях сотрудников Healthcare Job Attrition, чтобы обучить модель классификации rand_forest() и затем извлечь важности признаков. Чтобы важности признаков стали доступны, при создании модели обязательно задайте параметр importance = "impurity". Обучающая (train) и тестовая (test) выборки уже доступны вам.
Пакеты tidyverse, tidymodels и vip загружены заранее.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Определите модель классификации на основе случайного леса из 200 деревьев с возможностью извлечения важностей признаков.
- Обучите модель случайного леса, используя все предикторы.
- Присоедините предсказания к тестовой выборке.
- Вычислите метрику F1.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>%
set_engine("___", ___ = "___")
# Fit the random forest model with all predictors
rf_fit <- ___ %>%
___(___, data = ___)
# Create the test set prediction data frame
predict_df <- ___ %>%
bind_cols(predict = ___(___, ___))
# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)