用隨機森林模型預測腳踏車租借量
在這個練習中,你會使用前一題訓練好的模型,來預測 8 月的腳踏車租借量。
ranger 模型的 predict()(文件)會回傳一個 list。這個 list 的其中一個元素是 predictions,也就是預測值的向量。你可以用 list 具名元素的 $ 語法來存取 predictions:
predict(model, data)$predictions
模型 bike_model_rf 與資料集 bikesAugust(用於評估)已經預先載入。
本練習屬於課程
R 中的監督式學習:回歸
練習說明
- 對
bikesAugust呼叫predict(),預測 8 月租借的腳踏車數量(cnt)。將預測值以欄位pred加到bikesAugust。 - 填空計算預測的均方根誤差(RMSE)。
- 你先前為此資料建立的 Poisson 模型的 RMSE 約為 112.6。這個模型相比如何?
- 填空繪製實際的腳踏車租借量(
cnt)與預測值(pred為 x 軸)之間的對照圖。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# bikesAugust is available
str(bikesAugust)
# bike_model_rf is available
bike_model_rf
# Make predictions on the August data
bikesAugust$pred <- ___(___, ___)$___
# Calculate the RMSE of the predictions
bikesAugust %>%
mutate(residual = ___) %>% # calculate the residual
summarize(rmse = ___) # calculate rmse
# Plot actual outcome vs predictions (predictions on x-axis)
ggplot(bikesAugust, aes(x = ___, y = ___)) +
geom_point() +
geom_abline()