Случайный лес: построение модели
Как и градиентный бустинг деревьев, случайный лес — это ещё одна разновидность ансамблевой модели. Такие модели объединяют множество более простых моделей (снова деревьев решений), чтобы получить одну более точную. В отличие от итеративного подхода, в случайном лесу множество отдельных моделей обучаются параллельно — каждая на случайно выбранном подмножестве данных и случайно выбранном наборе признаков. Итоговое предсказание формируется путём агрегирования результатов всех отдельных моделей.
Для построения случайного леса в sparklyr используется функция ml_random_forest(). Её синтаксис полностью совпадает с синтаксисом ml_gradient_boosted_trees() (см. первое упражнение этой главы для напоминания).
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark уже создано и доступно как spark_conn. Tibble, связанный с объединёнными и отфильтрованными метаданными треков и данными о тембре, хранящимися в Spark, предварительно определён как track_data_to_model_tbl.
- Повторите анализ для предсказания года выпуска, на этот раз используя модель случайного леса.
- Получите столбцы
timbreизtrack_data_to_model_tblи сохраните результат вfeature_colnames. - Создайте формулу для модели с помощью
reformulate(). - Запустите модель случайного леса и сохраните результат в
random_forest_model.
- Получите столбцы
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___