НачатьНачать бесплатно

Построение полной модели случайного леса

Модели случайного леса по своей природе выполняют отбор признаков: при построении множества поддеревьев они каждый раз работают со случайными подмножествами признаков. Один из способов оценить важность признаков — обучить модель и извлечь соответствующие значения. В этом упражнении вы используете набор данных об увольнениях сотрудников Healthcare Job Attrition, чтобы обучить модель классификации rand_forest() и затем извлечь важности признаков. Чтобы важности признаков стали доступны, при создании модели обязательно задайте параметр importance = "impurity". Обучающая (train) и тестовая (test) выборки уже доступны вам.

Пакеты tidyverse, tidymodels и vip загружены заранее.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Определите модель классификации на основе случайного леса из 200 деревьев с возможностью извлечения важностей признаков.
  • Обучите модель случайного леса, используя все предикторы.
  • Присоедините предсказания к тестовой выборке.
  • Вычислите метрику F1.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>% 
  set_engine("___", ___ = "___") 

# Fit the random forest model with all predictors
rf_fit <- ___ %>% 
  ___(___, data = ___)

# Create the test set prediction data frame
predict_df <- ___ %>% 
  bind_cols(predict = ___(___, ___))

# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)
Редактировать и запускать код