切分資料集
在建立訓練集與測試集之前,先用 set.seed() 設定種子。種子能為隨機數產生一個固定起點,讓每次執行程式碼時都得到相同結果。這麼做的好處是,只要使用相同的種子,你或其他人都能重現完全相同的訓練集與測試集。
接著使用 sample() 將觀測值隨機分配到訓練集與測試集。
在這個練習中,你會用到 sample() 函式的前兩個引數:
- 第一個引數是要從中抽樣的向量。我們會隨機挑選列號作為索引;你可以用
1:nrow(loan_data)產生列號向量。 - 第二個引數是要抽取的項目數。我們先建立訓練集,因此會輸入
2 / 3 * nrow(loan_data)。
本練習屬於課程
R 的信用風險建模
練習說明
- 使用
set.seed()將種子設為 567。 - 將訓練集的列索引存到物件
index_train。依照上方說明,使用sample()的第一與第二個引數。 - 從資料集
loan_data中選取index_train所指定的列,建立訓練集,並將結果存為training_set。 - 測試集包含不在
index_train裡的那些列。請複製你建立訓練集的程式碼,但在中括號內的index_train前面加上負號(-)。將結果存為test_set。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Set seed of 567
# Store row numbers for training set: index_train
# Create training set: training_set
training_set <- loan_data[___, ]
# Create test set: test_set