НачатьНачать бесплатно

Разделение данных на обучающую и тестовую выборки

Первый шаг при обучении модели — разделение данных на обучающую и тестовую выборки. Пакет tidymodels делает это очень удобным. Наличие отдельной тестовой выборки позволяет оценить обученную модель на данных, которые она ещё не видела.

Вы будете работать с данными об оттоке сотрудников медицинской компании: в наборе содержится информация о работниках и о том, покинули ли они организацию. Данные доступны в объекте attrition_df. Целевая переменная — Attrition.

Пакеты tidyverse и tidymodels уже загружены.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте разбиение данных, выделив 80% для обучения, и задайте стратификацию по целевой переменной Attrition.
  • Извлеките обучающую выборку и сохраните её в переменную train.
  • Извлеките тестовую выборку и сохраните её в переменную test.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Initialize the split
split <- ___(___, ___ = ___, strata = ___)

# Extract training set
train <- ___ %>% ___()

# Extract testing set
test <- ___ %>% ___()
Редактировать и запускать код