Boosting 比 bagging 更進階,因為模型是序列式訓練,每個模型都在前一個模型的基礎上改進,而不是所有模型同時並行學習。有多個 R 套件實作了這個強大的演算法,而 tidymodels 也幫你準備好了。它提供了產生提升式樹模型的簡潔介面。
tidymodels
接下來的三個步驟中,你的任務是建立一個將在後續練習中使用的提升式樹集成的初始規格。
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Specify the model class boost_spec <-___() boost_spec
準備好打造一條真正的機器學習流程了嗎?透過循序練習,你會學會建立決策樹、切分資料,並預測哪些病患最可能罹患糖尿病。最後,你將建立效能衡量指標來評估模型,並檢視你的預測表現。
想來點甜的嗎?使用巧克力評分資料集來建立迴歸樹,並用合適的誤差指標評估其效能。你將透過如交叉驗證等「甜蜜」技巧,克服單一次訓練/測試切分在統計上的不安,接著更進一步掌握偏差—變異取捨。
現在開始嚴肅調校你的超參數,並解讀接收者操作特徵(ROC)曲線。本章中,你將運用集成模型(如 bagging 或隨機森林)的群體智慧,建立能預測哪些信用卡客戶最可能流失的集成模型。
準備好進入樹狀模型的上流社會了嗎?套用梯度提升來打造強大的集成模型,其表現勝過你先前看過或建立過的一切。你會學到如何微調這些模型,並比較不同模型,挑出可上線部署的最佳解。
當前練習