From zero to hero
你已經學會如何建立模型規格,並將資料分成訓練集與測試集。 你也知道如何在分割時避免類別不平衡。 現在是時候把上一節所學整合起來,只用訓練集來建立你的模型!
你將要建立一個完整的「機器學習管線(machine learning pipeline)」。 它包含:建立模型規格、將資料分成訓練集與測試集,最後也是很重要的一步,把訓練資料擬合到模型上。享受這個過程吧!
本練習屬於課程
R 的樹狀模型機器學習
練習說明
- 建立
diabetes_split:訓練集包含所有diabetes列的四分之三,且訓練集與測試集在outcome變數上的分佈相近。 - 使用
rpart引擎為你的模型建立決策樹規格,並將其儲存為tree_spec。 - 使用
diabetes_split的訓練資料擬合模型model_trained,以outcome為目標變數,bmi與skin_thickness為預測變數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained