Разделение данных
В этом упражнении вы разделите данные на обучающую и тестовую выборки с помощью пакета caret. В следующих уроках вы будете использовать обучающую выборку для построения моделей логистической регрессии, а тестовую — для их проверки.
Это упражнение является частью курса
HR-аналитика: прогнозирование текучести кадров на R
Инструкции к упражнению
- Загрузите пакет
caret. - Установите зерно генератора случайных чисел равным 567 и создайте раздел данных, который делит набор данных
emp_finalна 70% для обучения и 30% для тестирования. - Создайте обучающую выборку, выбрав номера строк, хранящиеся в
index_train, из набора данныхemp_final. - Присвойте оставшиеся наблюдения из
emp_finalтестовой выборке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load caret
___
# Set seed of 567
___
# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)
# Create training dataset: train_set
train_set <- emp_final[___, ]
# Create testing dataset: test_set
test_set <- emp_final[___, ]