Компроміс під час повторної вибірки
Велика техкомпанія хоче прогнозувати плинність кадрів для підвищення утримання працівників. Але лише 12% співробітників звільнилися, тож модель навчається переважно на випадках «залишилися» (88%), що ускладнює виявлення тих, хто ризикує піти.
Щоб усунути цей дисбаланс, фахівці з HR застосовують синтетичну повторну вибірку, створюючи більше випадків «звільнився» для балансування даних.
Ключова вимога: модель має уникати неправильного віднесення лояльних співробітників до «високого ризику звільнення», щоб не витрачати даремно ресурси на їх утримання.
Модель оцінюють за такими показниками:
- Training accuracy: частка правильних передбачень на тренувальних даних.
- Test accuracy: частка правильних передбачень на нових даних.
- Precision: частка передбачених «звільнень», які справді відбулися.
| Metric | Model A (without resampling) | Model B (with resampling) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
Ця вправа є частиною курсу
Просунута ймовірність: невизначеність у даних
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу