CommencezCommencez gratuitement

Le compromis du rééchantillonnage

Une grande entreprise technologique veut prédire l'attrition des employés pour améliorer la rétention. Mais seulement 12 % des employés ont quitté, donc le modèle est surtout entraîné sur des cas de « demeurés en poste » (88 %), ce qui rend difficile la détection des personnes à risque de partir.

Pour corriger ce déséquilibre, les analystes RH utilisent le rééchantillonnage synthétique afin de créer plus de cas « départ » et d'équilibrer les données.

Une exigence clé : le modèle doit éviter de classer à tort des employés loyaux comme « à haut risque de départ », afin d'éviter des efforts de rétention inutiles.

Le modèle est évalué à l'aide de :

  • Précision sur l'entraînement : prédictions correctes sur les données d'entraînement.
  • Précision sur le test : prédictions correctes sur de nouvelles données.
  • Précision (precision) : parmi les personnes prédites comme partantes, combien ont réellement quitté.
Indicateur Modèle A (sans rééchantillonnage) Modèle B (avec rééchantillonnage)
Précision à l'entraînement 85 % 95 %
Précision au test 82 % 85 %
Précision 80 % 68 %

Cette activité fait partie du cours

Probabilité avancée : l'incertitude dans les données

Voir le cours

Exercice interactif pratique

Passez de la théorie à l’action grâce à l’un de nos exercices interactifs

Commencer l’exercice