資料重抽樣
機器學習專案的第一步,是建立用於模型擬合與評估的訓練與測試資料集。測試資料集能估計模型在新資料上的表現,並有助於避免過度擬合。
你將使用 telecom_df 資料集,它包含某家電信公司的客戶資訊。目標變數是 canceled_service,記錄客戶是否取消與公司的合約。預測變數則包含客戶的行動電話與網際網路使用情形,以及合約類型與每月費用等資訊。
tibble 物件 telecom_df 已載入到你的工作階段。
本練習屬於課程
在 R 中使用 tidymodels 建立模型
練習說明
- 建立一個
rsample物件telecom_split,其中包含將telecom_df隨機切分為訓練與測試資料集的設定。- 將 75% 的資料分配到訓練集,並依
canceled_service進行分層抽樣。
- 將 75% 的資料分配到訓練集,並依
- 將
telecom_split物件傳入適當的rsample函式,以建立訓練與測試資料集。 - 將各資料集傳入
nrow()函式以檢查其列數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)