始める無料で始める

前処理手法の組み合わせ

train()preProcess 引数は、欠損値の代入だけに限りません。データサイエンティストの作業を大幅に楽にする、幅広い preProcess 手法が用意されています。全一覧は ?preProcess と入力して、この関数のヘルプページを参照してください。

回帰モデルの学習で特に有用な前処理のひとつが標準化(センタリングとスケーリング)です。まず各列の平均を各値から引いて「センタリング」し、その後、標準偏差で割って「スケーリング」します。

標準化により、各列の平均が0、標準偏差が1になるようにデータが変換されます。これにより、回帰モデルが良い解を見つけやすくなります。

この演習はコースの一部です

Rで学ぶ caret を使った Machine Learning

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Fit glm with median imputation
model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print model
コードを編集して実行