CommencezCommencez gratuitement

Division des données des employés

Le surapprentissage d'un jeu de données est un problème courant en analytique. Cela se produit lorsqu'un modèle performe bien sur les données ayant servi à son élaboration, mais n'arrive pas à se généraliser à l'extérieur de celles-ci.

On met en place une division entraînement/test pour assurer la généralisation du modèle : vous élaborez le modèle à l'aide de l'échantillon d'entraînement, puis vous l'évaluez ensuite sur l'échantillon de test.

Dans cet exercice, vous diviserez target et features en ensembles d'entraînement et de test selon un ratio de 75 %/25 %, respectivement.

Cette activité fait partie du cours

Analytique RH : prédire le roulement du personnel avec Python

Voir le cours

Instructions de l’exercice

  • Importez train_test_split du module sklearn.model_selection
  • Utilisez train_test_split() pour diviser votre jeu de données en ensembles d'entraînement et de test
  • Attribuez 25 % de vos observations à l'ensemble de test

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Modifier et exécuter le code