Поділ даних про співробітників
Перенавчання набору даних — поширена проблема в аналітиці. Це трапляється, коли модель добре працює на даних, на яких її навчали, але не узагальнює результати за їх межами.
Щоб забезпечити узагальнюваність моделі, застосовують поділ на тренувальну й тестову вибірки: ви розробляєте модель на тренувальній вибірці, а потім перевіряєте її на тестовій.
У цій вправі ви поділите target і features на тренувальний і тестовий набори у співвідношенні 75%/25% відповідно.
Ця вправа є частиною курсу
HR Analytics: прогнозування плинності персоналу в Python
Інструкції до вправи
- Імпортуйте
train_test_splitз модуляsklearn.model_selection - Використайте
train_test_split()для поділу вашого набору даних на тренувальний і тестовий - Віднесіть 25% ваших спостережень до тестового набору
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)