交叉驗證資料框
現在你已經保留一部分資料作為「測試資料」,可以用剩下的部分來尋找效能最佳的模型。
在這個練習中,你會使用 rsample 套件的 vfold_cv() 函式,將訓練資料切成一系列的 5 組 train-validate 集合。
本練習屬於課程
Tidyverse 的 Machine Learning
練習說明
- 使用
vfold_cv()從training_data建立 5 折交叉驗證的資料框,並指派給cv_split。 - 準備
cv_data:在cv_split中新增兩個欄位:train:對splits欄位套用對映,使用training()取得各組的 train 資料框。validate:對splits欄位套用對映,使用testing()取得各組的 validate 資料框。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)