開始使用免費開始

資料重抽樣

機器學習專案的第一步,是建立用於模型擬合與評估的訓練與測試資料集。測試資料集能估計模型在新資料上的表現,並有助於避免過度擬合。

你將使用 telecom_df 資料集,它包含某家電信公司的客戶資訊。目標變數是 canceled_service,記錄客戶是否取消與公司的合約。預測變數則包含客戶的行動電話與網際網路使用情形,以及合約類型與每月費用等資訊。

tibble 物件 telecom_df 已載入到你的工作階段。

本練習屬於課程

在 R 中使用 tidymodels 建立模型

檢視課程

練習說明

  • 建立一個 rsample 物件 telecom_split,其中包含將 telecom_df 隨機切分為訓練與測試資料集的設定。
    • 將 75% 的資料分配到訓練集,並依 canceled_service 進行分層抽樣。
  • telecom_split 物件傳入適當的 rsample 函式,以建立訓練與測試資料集。
  • 將各資料集傳入 nrow() 函式以檢查其列數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create data split object
telecom_split <- ___(___, prop = ___,
                     strata = ___)

# Create the training data
telecom_training <- ___ %>% 
  ___

# Create the test data
telecom_test <- ___ %>% 
  ___

# Check the number of rows
nrow(___)
nrow(___)
編輯並執行程式碼