開始使用免費開始

建立資料分折

只把資料分一次成訓練集與測試集在統計上不夠穩健——有小機率會出現測試集中剛好都是高評分可可豆,而低評分的都落在訓練集中。 這也代表你只能評估模型效能一次。

交叉驗證能在不踩統計陷阱的情況下,提供較穩健的取樣外效能估計——能更全面地評估你的模型。

在這個練習中,你會為已載入的訓練資料 chocolate_train 建立分折。

本練習屬於課程

R 的樹狀模型機器學習

檢視課程

練習說明

  • 為了可重現性,將隨機種子設為 20。
  • chocolate_train 建立成 10 個分折,並將結果儲存為 chocolate_folds

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Set seed for reproducibility
___

# Build 10 folds
chocolate_folds <- ___(___, v = ___)

print(chocolate_folds)
編輯並執行程式碼