开始使用免费开始使用

创建随机测试数据集

在构建更复杂的放贷模型之前,先保留一部分贷款数据,用来模拟模型对未来申请者结果的预测效果,这一点很重要。

如下图所示,您可以用 75% 的观测用于训练,25% 用于测试模型。

sample() 函数可用于随机抽取要纳入训练集的行。只需向其提供观测总数以及训练所需的数量即可。

使用得到的行 ID 向量对子集化贷款数据,分别构建训练集与测试集。数据集 loans 已为您准备好。

本练习是课程的一部分

R 中的监督学习:分类

查看课程

练习说明

  • 使用 nrow() 函数确定 loans 数据集中有多少观测,以及 75% 抽样所需的数量。
  • 使用 sample() 函数为 75% 抽样创建一个由行 ID 组成的整数向量。sample() 的第 1 个参数应为数据集的行数,第 2 个参数为训练集需要的行数。
  • 使用这些行 ID 对 loans 进行子集化,创建训练数据集,并保存为 loans_train
  • 再次对子集化 loans,这一次选择所有不在 sample_rows 中的行。将其保存为 loans_test

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
编辑并运行代码