Avvägningen vid omsampling
Ett stort teknikföretag vill förutsäga personalomsättning för att förbättra medarbetarretentionen. Bara 12 % av de anställda har slutat, vilket innebär att modellen till stor del tränas på "stannar"-fall (88 %) – och det gör det svårt att identifiera dem som riskerar att lämna.
För att åtgärda denna obalans använder HR-analytiker syntetisk omsampling för att skapa fler "lämnar"-fall och balansera datamängden.
Nyckelkrav: modellen bör undvika att felklassificera lojala anställda som "högriskpersoner", för att undvika onödiga insatser för att behålla dem.
Modellen utvärderas med hjälp av:
- Träningsnoggrannhet: korrekta förutsägelser på träningsdata.
- Testnoggrannhet: korrekta förutsägelser på nya data.
- Precision: hur stor andel av de förutsagda som lämnar faktiskt lämnade.
| Mätvärde | Modell A (utan omsampling) | Modell B (med omsampling) |
|---|---|---|
| Träningsnoggrannhet | 85 % | 95 % |
| Testnoggrannhet | 82 % | 85 % |
| Precision | 80 % | 68 % |
Den här övningen är en del av kursen
Avancerad sannolikhetslära: Osäkerhet i data
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen