隨機森林:視覺化
接下來你需要把預測結果畫出來。先前在梯度提升樹模型中,你已經畫過「預測值對實際值」的散佈圖,以及殘差的機率密度圖。現在要調整這些圖,讓它們同時呈現兩個模型的結果。
本練習屬於課程
使用 R 的 sparklyr:Spark 入門
練習說明
我們已經預先建立了一個本地的 tibble both_responses,其中包含兩個模型的預測年份與實際年份。
- 更新「預測值對實際值」的散佈圖。
- 使用資料集
both_responses。 - 加入顏色對映,讓不同模型用不同顏色呈現。使用
color = model。 - 不要畫點,改用
geom_smooth()為每個模型繪製平滑曲線。
- 使用資料集
- 建立名為
residuals的殘差 tibble。- 對
both_responses呼叫mutate()。 - 新欄位名稱為
residual。 residual應等於預測值減去實際值。
- 對
- 更新殘差的機率密度圖。
- 加入顏色對映,讓不同模型用不同顏色呈現。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# both_responses has been pre-defined
both_responses
# Draw a scatterplot of predicted vs. actual
ggplot(___, aes(actual, predicted, ___)) +
# Add a smoothed line
___ +
# Add a line at actual = predicted
geom_abline(intercept = 0, slope = 1)
# Create a tibble of residuals
residuals <- ___
# Draw a density plot of residuals
ggplot(residuals, aes(residual, ___)) +
# Add a density curve
geom_density() +
# Add a vertical line through zero
geom_vline(xintercept = 0)