前処理手法の組み合わせ
train() の preProcess 引数は、欠損値の代入だけに限りません。データサイエンティストの作業を大幅に楽にする、幅広い preProcess 手法が用意されています。全一覧は ?preProcess と入力して、この関数のヘルプページを参照してください。
回帰モデルの学習で特に有用な前処理のひとつが標準化(センタリングとスケーリング)です。まず各列の平均を各値から引いて「センタリング」し、その後、標準偏差で割って「スケーリング」します。
標準化により、各列の平均が0、標準偏差が1になるようにデータが変換されます。これにより、回帰モデルが良い解を見つけやすくなります。
この演習はコースの一部です
Rで学ぶ caret を使った Machine Learning
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Fit glm with median imputation
model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print model