Сокращение данных с помощью важности признаков
Теперь, когда вы построили полную модель случайного леса, вы изучите важность признаков.
Хотя модели случайного леса естественным образом — пусть и неявно — выполняют отбор признаков, зачастую полезно построить сокращённую модель. Она обучается быстрее, быстрее вычисляет предсказания и проще в понимании и сопровождении. Конечно, здесь всегда существует компромисс между простотой и качеством модели.
В этом упражнении вы сократите набор данных. В следующем упражнении вы обучите сокращённую модель и сравните её качество с полной. Объекты rf_fit, train и test уже подготовлены для вас.
Пакеты tidyverse, tidymodels и vip загружены заранее.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Используйте функцию
vi()с параметромrank, чтобы извлечь десять наиболее важных признаков. - Добавьте целевую переменную обратно в список ключевых признаков.
- Примените маску ключевых признаков, чтобы сократить наборы данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Extract the top ten features
top_features <- ___ %>%
___(___ = ___) %>%
filter(___) %>%
pull(Variable)
# Add the target variable to the feature list
top_features <- c(___, "___")
# Reduce and print the data sets
train_reduced <- train[___]
test_reduced <- ___[___]
train_reduced %>% head(5)
test_reduced %>% head(5)