クロスバリデーション用データフレーム
すでにデータの一部をテストデータとして取り分けましたので、残りのデータで最も良いモデルを探していきます。
この演習では、rsample パッケージの vfold_cv() 関数を使い、学習データを 5 組の train-validate セットに分割します。
この演習はコースの一部です
Tidyverse で学ぶ Machine Learning
演習の手順
training_dataからvfold_cv()を使って 5-fold クロスバリデーション用のデータフレームを作成し、cv_splitに代入します。cv_splitに新しい 2 列を追加してcv_dataを用意します:train:splits列に対してtraining()をマッピングして、学習用データフレームを格納します。validate:splits列に対してtesting()をマッピングして、検証用データフレームを格納します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)