НачатьНачать бесплатно

Сравнение качества моделей

Визуализация даёт хорошее представление о том, где модель работает хорошо, а где — не очень. Однако иногда полезно иметь численную метрику, которая позволяет оценить качество модели, сравнивать разные модели между собой и формализовать это сравнение. Одна из наиболее распространённых метрик — среднеквадратичная ошибка (RMSE, от англ. root mean square error): остатки возводятся в квадрат, затем вычисляется среднее значение, а после — квадратный корень. Чем меньше значение RMSE для данного набора данных, тем лучше предсказания модели. (По умолчанию RMSE позволяет сравнивать только разные модели на одном и том же наборе данных, а не разные наборы данных между собой. В ряде случаев наборы данных можно нормализовать, чтобы всё же провести такое сравнение.)

В этом упражнении вы сравните модель на основе градиентного бустинга над деревьями решений и модель случайного леса.

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

both_responses — локальный тиббл с предсказанными и фактическими годами для каждого трека от обеих моделей. Он уже определён заранее.

  • Создайте набор данных с суммой квадратов остатков.
    • Добавьте столбец residual, равный разности между предсказанным и фактическим значением.
    • Сгруппируйте данные по столбцу model.
    • Вычислите сводную статистику rmse — квадратный корень из среднего квадратов значений столбца residual.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# both_responses has been pre-defined
both_responses

# Create a residual sum of squares dataset
___
Редактировать и запускать код