НачатьНачать бесплатно

Разделение данных

В этом упражнении вы разделите данные на обучающую и тестовую выборки с помощью пакета caret. В следующих уроках вы будете использовать обучающую выборку для построения моделей логистической регрессии, а тестовую — для их проверки.

Это упражнение является частью курса

HR-аналитика: прогнозирование текучести кадров на R

Посмотреть курс

Инструкции к упражнению

  • Загрузите пакет caret.
  • Установите зерно генератора случайных чисел равным 567 и создайте раздел данных, который делит набор данных emp_final на 70% для обучения и 30% для тестирования.
  • Создайте обучающую выборку, выбрав номера строк, хранящиеся в index_train, из набора данных emp_final.
  • Присвойте оставшиеся наблюдения из emp_final тестовой выборке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load caret
___

# Set seed of 567
___

# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)

# Create training dataset: train_set
train_set <- emp_final[___, ]

# Create testing dataset: test_set
test_set <- emp_final[___, ]
Редактировать и запускать код