開始使用免費開始

比較模型效能

用視覺化可以直觀了解模型在哪些地方表現良好、哪些地方不佳。不過,有時候擁有一個能為模型打分數的統計量會更方便。這能量化模型的好壞,並讓你在許多模型之間進行比較。常見的統計量是均方根誤差(root mean square error,常縮寫為「RMSE」),做法是先將殘差平方、取平均,再開根號。對同一個資料集而言,RMSE 越小代表預測越好。(預設情況下,你不能在不同資料集之間比較,只能比較同一資料集上的不同模型。有時可以透過正規化資料集,來在資料集之間進行比較。)

在這裡你會比較 gradient boosted trees 與 random forest 兩個模型。

本練習屬於課程

使用 R 的 sparklyr:Spark 入門

檢視課程

練習說明

已事先在本地建立 both_responses 這個 tibble,包含兩個模型的曲目預測年份與實際年份。

  • 建立一個殘差平方和的資料集。
    • 新增 residual 欄位,等於預測值減去實際值。
    • model 分組。
    • 計算摘要統計量 rmse,等於殘差平方的平均再開根號。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# both_responses has been pre-defined
both_responses

# Create a residual sum of squares dataset
___
編輯並執行程式碼