比較模型效能
用視覺化可以直觀了解模型在哪些地方表現良好、哪些地方不佳。不過,有時候擁有一個能為模型打分數的統計量會更方便。這能量化模型的好壞,並讓你在許多模型之間進行比較。常見的統計量是均方根誤差(root mean square error,常縮寫為「RMSE」),做法是先將殘差平方、取平均,再開根號。對同一個資料集而言,RMSE 越小代表預測越好。(預設情況下,你不能在不同資料集之間比較,只能比較同一資料集上的不同模型。有時可以透過正規化資料集,來在資料集之間進行比較。)
在這裡你會比較 gradient boosted trees 與 random forest 兩個模型。
本練習屬於課程
使用 R 的 sparklyr:Spark 入門
練習說明
已事先在本地建立 both_responses 這個 tibble,包含兩個模型的曲目預測年份與實際年份。
- 建立一個殘差平方和的資料集。
- 新增
residual欄位,等於預測值減去實際值。 - 依
model分組。 - 計算摘要統計量
rmse,等於殘差平方的平均再開根號。
- 新增
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# both_responses has been pre-defined
both_responses
# Create a residual sum of squares dataset
___