НачатьНачать бесплатно

Компромиссы при ресэмплинге

Крупная технологическая компания хочет прогнозировать увольнения сотрудников, чтобы улучшить показатели удержания. Однако лишь 12% сотрудников покинули компанию, поэтому модель обучается преимущественно на случаях «остался» (88%) — это затрудняет выявление тех, кто рискует уйти.

Чтобы устранить этот дисбаланс, HR-аналитики применяют синтетический ресэмплинг: создают дополнительные случаи «уволился» и выравнивают данные.

Ключевое требование: модель не должна ошибочно относить лояльных сотрудников к категории «высокого риска увольнения», чтобы не тратить ресурсы на удержание впустую.

Модель оценивается по следующим метрикам:

  • Точность на обучении: доля верных предсказаний на обучающих данных.
  • Точность на тесте: доля верных предсказаний на новых данных.
  • Precision: какая доля предсказанных «уволившихся» действительно уволилась.
Метрика Модель A (без ресэмплинга) Модель B (с ресэмплингом)
Точность на обучении 85% 95%
Точность на тесте 82% 85%
Precision 80% 68%

Это упражнение является частью курса

Продвинутая теория вероятностей: неопределённость в данных

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение