始める無料で始める

クロスバリデーション用データフレーム

すでにデータの一部をテストデータとして取り分けましたので、残りのデータで最も良いモデルを探していきます。

この演習では、rsample パッケージの vfold_cv() 関数を使い、学習データを 5 組の train-validate セットに分割します。

この演習はコースの一部です

Tidyverse で学ぶ Machine Learning

コースを見る

演習の手順

  • training_data から vfold_cv() を使って 5-fold クロスバリデーション用のデータフレームを作成し、cv_split に代入します。
  • cv_split に新しい 2 列を追加して cv_data を用意します:
    • train: splits 列に対して training() をマッピングして、学習用データフレームを格納します。
    • validate: splits 列に対して testing() をマッピングして、検証用データフレームを格納します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
コードを編集して実行