建立隨機測試資料集
在建立更進階的放款模型之前,先保留一部分放款資料很重要,這能模擬模型對未來申貸者結果的預測表現。
如下圖所示,你可以用 75% 的觀測值來訓練,25% 用來測試模型。

sample() 函式可用來隨機抽取要放入訓練集的列,只要提供「觀測值總數」與「訓練所需筆數」即可。
使用得到的列 ID 向量,將 loans 分割為訓練與測試兩個資料集。資料集 loans 已可供你使用。
本練習屬於課程
R 監督式學習:分類
練習說明
- 套用
nrow()函式來確認loans資料集中有多少筆觀測值,並計算 75% 抽樣需要的筆數。 - 使用
sample()函式建立代表 75% 抽樣之列 ID 的整數向量。sample()的第一個引數應為資料集的列數,第二個引數則是訓練集所需的列數。 - 使用這些列 ID 對
loans進行子集篩選,建立訓練資料集,並將其儲存為loans_train。 - 再次對
loans進行子集篩選,但這次選取所有「不在」sample_rows裡的列,並將結果儲存為loans_test。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]