Division des données des employés
Le surapprentissage d'un jeu de données est un problème courant en analytique. Cela se produit lorsqu'un modèle performe bien sur les données ayant servi à son élaboration, mais n'arrive pas à se généraliser à l'extérieur de celles-ci.
On met en place une division entraînement/test pour assurer la généralisation du modèle : vous élaborez le modèle à l'aide de l'échantillon d'entraînement, puis vous l'évaluez ensuite sur l'échantillon de test.
Dans cet exercice, vous diviserez target et features en ensembles d'entraînement et de test selon un ratio de 75 %/25 %, respectivement.
Cette activité fait partie du cours
Analytique RH : prédire le roulement du personnel avec Python
Instructions de l’exercice
- Importez
train_test_splitdu modulesklearn.model_selection - Utilisez
train_test_split()pour diviser votre jeu de données en ensembles d'entraînement et de test - Attribuez 25 % de vos observations à l'ensemble de test
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)