開始使用免費開始

切分資料集

在建立訓練集與測試集之前,先用 set.seed() 設定種子。種子能為隨機數產生一個固定起點,讓每次執行程式碼時都得到相同結果。這麼做的好處是,只要使用相同的種子,你或其他人都能重現完全相同的訓練集與測試集。

接著使用 sample() 將觀測值隨機分配到訓練集與測試集。

在這個練習中,你會用到 sample() 函式的前兩個引數:

  • 第一個引數是要從中抽樣的向量。我們會隨機挑選列號作為索引;你可以用 1:nrow(loan_data) 產生列號向量。
  • 第二個引數是要抽取的項目數。我們先建立訓練集,因此會輸入 2 / 3 * nrow(loan_data)

本練習屬於課程

R 的信用風險建模

檢視課程

練習說明

  • 使用 set.seed() 將種子設為 567。
  • 將訓練集的列索引存到物件 index_train。依照上方說明,使用 sample() 的第一與第二個引數。
  • 從資料集 loan_data 中選取 index_train 所指定的列,建立訓練集,並將結果存為 training_set
  • 測試集包含不在 index_train 裡的那些列。請複製你建立訓練集的程式碼,但在中括號內的 index_train 前面加上負號(-)。將結果存為 test_set

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Set seed of 567


# Store row numbers for training set: index_train


# Create training set: training_set
training_set <- loan_data[___, ]

# Create test set: test_set
編輯並執行程式碼