НачатьНачать бесплатно

Случайный лес: построение модели

Как и градиентный бустинг деревьев, случайный лес — это ещё одна разновидность ансамблевой модели. Такие модели объединяют множество более простых моделей (снова деревьев решений), чтобы получить одну более точную. В отличие от итеративного подхода, в случайном лесу множество отдельных моделей обучаются параллельно — каждая на случайно выбранном подмножестве данных и случайно выбранном наборе признаков. Итоговое предсказание формируется путём агрегирования результатов всех отдельных моделей.

Для построения случайного леса в sparklyr используется функция ml_random_forest(). Её синтаксис полностью совпадает с синтаксисом ml_gradient_boosted_trees() (см. первое упражнение этой главы для напоминания).

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark уже создано и доступно как spark_conn. Tibble, связанный с объединёнными и отфильтрованными метаданными треков и данными о тембре, хранящимися в Spark, предварительно определён как track_data_to_model_tbl.

  • Повторите анализ для предсказания года выпуска, на этот раз используя модель случайного леса.
    • Получите столбцы timbre из track_data_to_model_tbl и сохраните результат в feature_colnames.
    • Создайте формулу для модели с помощью reformulate().
    • Запустите модель случайного леса и сохраните результат в random_forest_model.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl

# Get the timbre columns
feature_colnames <- ___

# Create the formula for the model
year_formula <- ___

# Run the random forest model
random_forest_model <- ___
Редактировать и запускать код