НачатьНачать бесплатно

Сокращение данных с помощью важности признаков

Теперь, когда вы построили полную модель случайного леса, вы изучите важность признаков.

Хотя модели случайного леса естественным образом — пусть и неявно — выполняют отбор признаков, зачастую полезно построить сокращённую модель. Она обучается быстрее, быстрее вычисляет предсказания и проще в понимании и сопровождении. Конечно, здесь всегда существует компромисс между простотой и качеством модели.

В этом упражнении вы сократите набор данных. В следующем упражнении вы обучите сокращённую модель и сравните её качество с полной. Объекты rf_fit, train и test уже подготовлены для вас.

Пакеты tidyverse, tidymodels и vip загружены заранее.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Используйте функцию vi() с параметром rank, чтобы извлечь десять наиболее важных признаков.
  • Добавьте целевую переменную обратно в список ключевых признаков.
  • Примените маску ключевых признаков, чтобы сократить наборы данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Extract the top ten features
top_features <- ___ %>% 
  ___(___ = ___) %>% 
  filter(___) %>% 
  pull(Variable)

# Add the target variable to the feature list
top_features <- c(___, "___")

# Reduce and print the data sets
train_reduced <- train[___]
test_reduced <- ___[___]
train_reduced %>% head(5)
test_reduced %>% head(5)
Редактировать и запускать код