結合多種前處理方法
train() 的 preProcess 參數不只用來做遺漏值插補。它還包含各式各樣的 preProcess 技術,能大幅簡化你做資料科學工作的流程。你可以輸入 ?preProcess,閱讀這個函式的說明頁面以查看完整清單。
有一組對於迴歸模型特別實用的前處理函式是標準化:置中與縮放。先進行「置中」(center),也就是把每欄的平均數從該欄的每個數值中扣除;接著再進行「縮放」(scale),將結果除以該欄的標準差。
標準化會把你的資料轉換成:對每一欄而言,平均數為 0、標準差為 1。這能讓迴歸模型更容易找到好的解。
本練習屬於課程
使用 R 的 caret 進行 Machine Learning
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model