创建随机测试数据集
在构建更复杂的放贷模型之前,先保留一部分贷款数据,用来模拟模型对未来申请者结果的预测效果,这一点很重要。
如下图所示,您可以用 75% 的观测用于训练,25% 用于测试模型。

sample() 函数可用于随机抽取要纳入训练集的行。只需向其提供观测总数以及训练所需的数量即可。
使用得到的行 ID 向量对子集化贷款数据,分别构建训练集与测试集。数据集 loans 已为您准备好。
本练习是课程的一部分
R 中的监督学习:分类
练习说明
- 使用
nrow()函数确定loans数据集中有多少观测,以及 75% 抽样所需的数量。 - 使用
sample()函数为 75% 抽样创建一个由行 ID 组成的整数向量。sample()的第 1 个参数应为数据集的行数,第 2 个参数为训练集需要的行数。 - 使用这些行 ID 对
loans进行子集化,创建训练数据集,并保存为loans_train。 - 再次对子集化
loans,这一次选择所有不在sample_rows中的行。将其保存为loans_test。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]