НачатьНачать бесплатно

Разделение данных о сотрудниках

Переобучение модели на наборе данных — распространённая проблема в аналитике. Она возникает, когда модель хорошо работает на тех данных, на которых была построена, но не справляется с новыми примерами.

Чтобы убедиться, что модель хорошо обобщается, применяют разбивку на обучающую и тестовую выборки: модель строится на обучающей выборке, а затем проверяется на тестовой.

В этом упражнении вы разделите target и features на обучающую и тестовую выборки в соотношении 75%/25%.

Это упражнение является частью курса

HR-аналитика: прогнозирование текучести кадров на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте train_test_split из модуля sklearn.model_selection
  • Используйте train_test_split(), чтобы разделить набор данных на обучающую и тестовую выборки
  • Выделите 25% наблюдений в тестовую выборку

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Редактировать и запускать код