ПочатиПочніть безкоштовно

Компроміс під час повторної вибірки

Велика техкомпанія хоче прогнозувати плинність кадрів для підвищення утримання працівників. Але лише 12% співробітників звільнилися, тож модель навчається переважно на випадках «залишилися» (88%), що ускладнює виявлення тих, хто ризикує піти.

Щоб усунути цей дисбаланс, фахівці з HR застосовують синтетичну повторну вибірку, створюючи більше випадків «звільнився» для балансування даних.

Ключова вимога: модель має уникати неправильного віднесення лояльних співробітників до «високого ризику звільнення», щоб не витрачати даремно ресурси на їх утримання.

Модель оцінюють за такими показниками:

  • Training accuracy: частка правильних передбачень на тренувальних даних.
  • Test accuracy: частка правильних передбачень на нових даних.
  • Precision: частка передбачених «звільнень», які справді відбулися.
Metric Model A (without resampling) Model B (with resampling)
Training accuracy 85% 95%
Test Accuracy 82% 85%
Precision 80% 68%

Ця вправа є частиною курсу

Просунута ймовірність: невизначеність у даних

Переглянути курс

Практична інтерактивна вправа

Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ

Почати вправу