Začněte nyníZačněte zdarma

Kompromisy resamplingových metod

Velká technologická společnost chce předpovídat fluktuaci zaměstnanců, aby zlepšila jejich udržení. Jenže pouze 12 % zaměstnanců společnost opustilo – model se tedy trénuje převážně na případech „zůstávám" (88 %), a je tak těžké rozpoznat ty, kteří jsou ohroženi odchodem.

Aby analytici z HR tuto nerovnováhu napravili, používají syntetický resampling a vytvářejí více případů „odcházím", čímž data vyvažují.

Klíčový požadavek: model by neměl mylně označovat loajální zaměstnance jako „vysoce rizikové", aby nedocházelo ke zbytečnému vynakládání udržovacích opatření.

Model se hodnotí pomocí těchto metrik:

  • Trénovací přesnost: správné předpovědi na trénovacích datech.
  • Testovací přesnost: správné předpovědi na nových datech.
  • Precision: kolik z předpovězených „odchodů" skutečně nastalo.
Metrika Model A (bez resamplingу) Model B (s resamplingem)
Trénovací přesnost 85 % 95 %
Testovací přesnost 82 % 85 %
Precision 80 % 68 %

Toto cvičení je součástí kurzu

Pokročilá pravděpodobnost: neurčitost v datech

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení