速度與準確度的權衡
在上一支影片中,你已經看到有兩個可調整的參數會影響隨機森林的效能:
- 每座森林中的決策樹數量。
- 在決策樹中用來分裂的變數數量。
提高這兩者都可能改善插補模型的準確度,但也會需要更長的執行時間。在這個練習中,你會親自動手,使用不同設定對 biopics 資料各別套用兩次 missForest()。依照說明操作時,請留意你將印出的誤差,以及程式碼執行所需的時間。
本練習屬於課程
在 R 中以插補處理遺漏值
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Set number of trees to 5 and number of variables used for splitting to 2
imp_res <- missForest(biopics, ___ = ___, ___ = ___)
# Print the resulting imputation errors
print(___)