開始使用免費開始

交叉驗證資料框

現在你已經保留一部分資料作為「測試資料」,可以用剩下的部分來尋找效能最佳的模型。

在這個練習中,你會使用 rsample 套件的 vfold_cv() 函式,將訓練資料切成一系列的 5 組 train-validate 集合。

本練習屬於課程

Tidyverse 的 Machine Learning

檢視課程

練習說明

  • 使用 vfold_cv()training_data 建立 5 折交叉驗證的資料框,並指派給 cv_split
  • 準備 cv_data:在 cv_split 中新增兩個欄位:
    • train:對 splits 欄位套用對映,使用 training() 取得各組的 train 資料框。
    • validate:對 splits 欄位套用對映,使用 testing() 取得各組的 validate 資料框。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
編輯並執行程式碼