開始使用免費開始

建立隨機測試資料集

在建立更進階的放款模型之前,先保留一部分放款資料很重要,這能模擬模型對未來申貸者結果的預測表現。

如下圖所示,你可以用 75% 的觀測值來訓練,25% 用來測試模型。

sample() 函式可用來隨機抽取要放入訓練集的列,只要提供「觀測值總數」與「訓練所需筆數」即可。

使用得到的列 ID 向量,將 loans 分割為訓練與測試兩個資料集。資料集 loans 已可供你使用。

本練習屬於課程

R 監督式學習:分類

檢視課程

練習說明

  • 套用 nrow() 函式來確認 loans 資料集中有多少筆觀測值,並計算 75% 抽樣需要的筆數。
  • 使用 sample() 函式建立代表 75% 抽樣之列 ID 的整數向量。sample() 的第一個引數應為資料集的列數,第二個引數則是訓練集所需的列數。
  • 使用這些列 ID 對 loans 進行子集篩選,建立訓練資料集,並將其儲存為 loans_train
  • 再次對 loans 進行子集篩選,但這次選取所有「不在」sample_rows 裡的列,並將結果儲存為 loans_test

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
編輯並執行程式碼