From zero to hero
モデル仕様を作成し、データを学習用とテスト用に分割するスキルを身につけました。 分割時のクラス不均衡を避ける方法も理解しています。 それでは、前のレッスンで学んだことを組み合わせ、学習データだけを使ってモデルを構築していきましょう!
ここでは本格的な「machine learning パイプライン」を作ります。 モデル仕様の作成、データの学習用・テスト用への分割、そして最後に学習データへのモデル当てはめ、という流れで進めます。楽しんでください!
この演習はコースの一部です
Rで学ぶTree-Based ModelsによるMachine Learning
演習の手順
diabetes_splitを作成します。学習用データがdiabetesの全行のうち 3/4 を含み、かつ学習用・テスト用の双方でoutcome変数の分布が似るように分割してください。rpartエンジンを使って決定木のモデル仕様を作成し、tree_specとして保存します。diabetes_splitの学習データを使い、目的変数をoutcome、説明変数をbmiとskin_thicknessとしてモデルを当てはめ、model_trainedを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained