建立資料分折
只把資料分一次成訓練集與測試集在統計上不夠穩健——有小機率會出現測試集中剛好都是高評分可可豆,而低評分的都落在訓練集中。 這也代表你只能評估模型效能一次。
交叉驗證能在不踩統計陷阱的情況下,提供較穩健的取樣外效能估計——能更全面地評估你的模型。
在這個練習中,你會為已載入的訓練資料 chocolate_train 建立分折。
本練習屬於課程
R 的樹狀模型機器學習
練習說明
- 為了可重現性,將隨機種子設為 20。
- 將
chocolate_train建立成 10 個分折,並將結果儲存為chocolate_folds。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Set seed for reproducibility
___
# Build 10 folds
chocolate_folds <- ___(___, v = ___)
print(chocolate_folds)