Разделение данных на обучающую и тестовую выборки
Первый шаг при обучении модели — разделение данных на обучающую и тестовую выборки. Пакет tidymodels делает это очень удобным. Наличие отдельной тестовой выборки позволяет оценить обученную модель на данных, которые она ещё не видела.
Вы будете работать с данными об оттоке сотрудников медицинской компании: в наборе содержится информация о работниках и о том, покинули ли они организацию. Данные доступны в объекте attrition_df. Целевая переменная — Attrition.
Пакеты tidyverse и tidymodels уже загружены.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Инициализируйте разбиение данных, выделив 80% для обучения, и задайте стратификацию по целевой переменной
Attrition. - Извлеките обучающую выборку и сохраните её в переменную
train. - Извлеките тестовую выборку и сохраните её в переменную
test.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize the split
split <- ___(___, ___ = ___, strata = ___)
# Extract training set
train <- ___ %>% ___()
# Extract testing set
test <- ___ %>% ___()