Разделение данных о сотрудниках
Переобучение модели на наборе данных — распространённая проблема в аналитике. Она возникает, когда модель хорошо работает на тех данных, на которых была построена, но не справляется с новыми примерами.
Чтобы убедиться, что модель хорошо обобщается, применяют разбивку на обучающую и тестовую выборки: модель строится на обучающей выборке, а затем проверяется на тестовой.
В этом упражнении вы разделите target и features на обучающую и тестовую выборки в соотношении 75%/25%.
Это упражнение является частью курса
HR-аналитика: прогнозирование текучести кадров на Python
Инструкции к упражнению
- Импортируйте
train_test_splitиз модуляsklearn.model_selection - Используйте
train_test_split(), чтобы разделить набор данных на обучающую и тестовую выборки - Выделите 25% наблюдений в тестовую выборку
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)