Спробуйте поділ 80/20
Тепер, коли ваш набір даних випадково перемішано, ви можете поділити перші 80% на тренувальну вибірку, а останні 20% — на тестову. Це можна зробити, обравши точку поділу приблизно на 80% довжини даних:
split <- round(nrow(mydata) * 0.80)
Далі використайте цю точку, щоб відокремити перші 80% набору даних як тренувальну вибірку:
mydata[1:split, ]
Потім використайте ту саму точку, щоб визначити тестову вибірку:
mydata[(split + 1):nrow(mydata), ]
Ця вправа є частиною курсу
Machine Learning з пакетом caret в R
Інструкції до вправи
- Оберіть індекс рядка для поділу так, щоб точка поділу була приблизно на 80% довжини набору даних
diamonds. Назвіть цей індексsplit. - Створіть тренувальну вибірку
train, використавши цей індекс. - Створіть тестову вибірку
test, використавши цей індекс.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Determine row to split on: split
# Create train
# Create test