尝试 80/20 划分
现在数据集已经随机排序,您可以将前 80% 划分为训练集,将最后 20% 划分为测试集。您可以先选择一个大约位于数据 80% 处的划分点:
split <- round(nrow(mydata) * 0.80)
然后使用该位置将前 80% 的数据集作为训练集:
mydata[1:split, ]
接着使用同一位置来确定测试集:
mydata[(split + 1):nrow(mydata), ]
本练习是课程的一部分
在 R 中使用 caret 的机器学习
练习说明
- 选择一个行索引作为划分点,使其大约位于
diamonds数据集的 80% 处。将该索引命名为split。 - 使用该索引创建名为
train的训练集。 - 使用该索引创建名为
test的测试集。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Determine row to split on: split
# Create train
# Create test