开始使用免费开始使用

创建训练集和测试集

将数据集划分为训练集和测试集是构建并检验分类模型的重要步骤。训练集用于构建模型,测试集用于评估模型的预测准确性。

在本练习中,您将把上一章创建的数据集划分为训练集和测试集。该数据集已加载到数据框 df 中,并且已经设置了随机种子以确保可复现性。回想上一段视频中,我们用了一些便捷函数来设置训练集长度的上界——现在轮到您来实现它们了!

本练习是课程的一部分

R 中的支持向量机

查看课程

练习说明

  • 计算训练集行数的上界,并将其存入 sample_size
  • 按照 80/20 的比例,创建向量 train,用于存储随机分配到训练集的行索引。
  • train 向量对应的行赋给数据框 trainset,其余行赋给数据框 testset

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
编辑并运行代码