變數重要度
你已經知道,袋裝樹(bagged trees)是一種整體學習模型,可以克服決策樹的高變異問題。現在你學到,隨機森林演算法會在每棵樹中只使用隨機子集合的特徵,進一步提升表現。這會降低整體模型中各樹之間的相關性,並提升預測效能。
在這個練習中,你將自己建立一個隨機森林,並使用 vip 套件繪製預測變數的重要度。訓練資料 customers_train 已預先載入到你的工作環境。
本練習屬於課程
R 的樹狀模型機器學習
練習說明
- 建立
spec:使用"ranger"引擎與"impurity"變數重要度的隨機森林分類模型規格。 - 建立
model:以still_customer為結果變數,其他欄位為解釋變數,將 tibblecustomers_train套用到spec進行擬合。 - 使用
vip套件中的vip()函式繪製變數重要度(此套件未預先載入)。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)