Le compromis du rééchantillonnage
Une grande entreprise technologique veut prédire l'attrition des employés pour améliorer la rétention. Mais seulement 12 % des employés ont quitté, donc le modèle est surtout entraîné sur des cas de « demeurés en poste » (88 %), ce qui rend difficile la détection des personnes à risque de partir.
Pour corriger ce déséquilibre, les analystes RH utilisent le rééchantillonnage synthétique afin de créer plus de cas « départ » et d'équilibrer les données.
Une exigence clé : le modèle doit éviter de classer à tort des employés loyaux comme « à haut risque de départ », afin d'éviter des efforts de rétention inutiles.
Le modèle est évalué à l'aide de :
- Précision sur l'entraînement : prédictions correctes sur les données d'entraînement.
- Précision sur le test : prédictions correctes sur de nouvelles données.
- Précision (precision) : parmi les personnes prédites comme partantes, combien ont réellement quitté.
| Indicateur | Modèle A (sans rééchantillonnage) | Modèle B (avec rééchantillonnage) |
|---|---|---|
| Précision à l'entraînement | 85 % | 95 % |
| Précision au test | 82 % | 85 % |
| Précision | 80 % | 68 % |
Cette activité fait partie du cours
Probabilité avancée : l'incertitude dans les données
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice