Прогнозирование аренды велосипедов с помощью модели случайного леса
В этом упражнении вы воспользуетесь моделью, обученной в предыдущем упражнении, чтобы спрогнозировать количество аренд велосипедов за август.
Функция predict() (docs) для модели ranger возвращает
список. Один из его элементов — predictions, вектор прогнозируемых значений. Обратиться к нему можно с помощью оператора $ для доступа к именованным элементам списка:
predict(model, data)$predictions
Модель bike_model_rf и набор данных bikesAugust (для оценки) уже загружены.
Это упражнение является частью курса
Обучение с учителем в R: регрессия
Инструкции к упражнению
- Вызовите функцию
predict()на данныхbikesAugust, чтобы спрогнозировать количество аренд велосипедов в августе (cnt). Добавьте прогнозы вbikesAugustв виде столбцаpred. - Заполните пропуски, чтобы вычислить среднеквадратическую ошибку (RMSE) прогнозов.
- Модель Пуассона, построенная для этих данных, дала RMSE около 112,6. Как эта модель соотносится с ней по качеству?
- Заполните пропуски, чтобы построить график фактического количества аренд велосипедов (
cnt) в зависимости от прогнозов (predпо оси X).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# bikesAugust is available
str(bikesAugust)
# bike_model_rf is available
bike_model_rf
# Make predictions on the August data
bikesAugust$pred <- ___(___, ___)$___
# Calculate the RMSE of the predictions
bikesAugust %>%
mutate(residual = ___) %>% # calculate the residual
summarize(rmse = ___) # calculate rmse
# Plot actual outcome vs predictions (predictions on x-axis)
ggplot(bikesAugust, aes(x = ___, y = ___)) +
geom_point() +
geom_abline()