Компромиссы при ресэмплинге
Крупная технологическая компания хочет прогнозировать увольнения сотрудников, чтобы улучшить показатели удержания. Однако лишь 12% сотрудников покинули компанию, поэтому модель обучается преимущественно на случаях «остался» (88%) — это затрудняет выявление тех, кто рискует уйти.
Чтобы устранить этот дисбаланс, HR-аналитики применяют синтетический ресэмплинг: создают дополнительные случаи «уволился» и выравнивают данные.
Ключевое требование: модель не должна ошибочно относить лояльных сотрудников к категории «высокого риска увольнения», чтобы не тратить ресурсы на удержание впустую.
Модель оценивается по следующим метрикам:
- Точность на обучении: доля верных предсказаний на обучающих данных.
- Точность на тесте: доля верных предсказаний на новых данных.
- Precision: какая доля предсказанных «уволившихся» действительно уволилась.
| Метрика | Модель A (без ресэмплинга) | Модель B (с ресэмплингом) |
|---|---|---|
| Точность на обучении | 85% | 95% |
| Точность на тесте | 82% | 85% |
| Precision | 80% | 68% |
Это упражнение является частью курса
Продвинутая теория вероятностей: неопределённость в данных
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение