データを分割する
この演習では、caret パッケージを使ってデータを訓練用セットとテスト用セットに分割します。次のレッスンでは、訓練セットでロジスティック回帰モデルを構築し、テストセットでモデルを検証します。
この演習はコースの一部です
HRアナリティクス:Rで社員離職を予測する
演習の手順
caretパッケージを読み込みます。- 乱数シードを 567 に設定し、データセット
emp_finalを 70% / 30% の訓練/テストに分割するデータパーティションを作成します。 - データセット
emp_finalから、index_trainに保存された行番号を選択して訓練データセットを作成します。 - 残りの
emp_finalのレコードをテストセットに割り当てます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load caret
___
# Set seed of 567
___
# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)
# Create training dataset: train_set
train_set <- emp_final[___, ]
# Create testing dataset: test_set
test_set <- emp_final[___, ]