创建训练集和测试集
将数据集划分为训练集和测试集是构建并检验分类模型的重要步骤。训练集用于构建模型,测试集用于评估模型的预测准确性。
在本练习中,您将把上一章创建的数据集划分为训练集和测试集。该数据集已加载到数据框 df 中,并且已经设置了随机种子以确保可复现性。回想上一段视频中,我们用了一些便捷函数来设置训练集长度的上界——现在轮到您来实现它们了!
本练习是课程的一部分
R 中的支持向量机
练习说明
- 计算训练集行数的上界,并将其存入
sample_size。 - 按照 80/20 的比例,创建向量
train,用于存储随机分配到训练集的行索引。 - 将
train向量对应的行赋给数据框trainset,其余行赋给数据框testset。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]