Kompromisy resamplingových metod
Velká technologická společnost chce předpovídat fluktuaci zaměstnanců, aby zlepšila jejich udržení. Jenže pouze 12 % zaměstnanců společnost opustilo – model se tedy trénuje převážně na případech „zůstávám" (88 %), a je tak těžké rozpoznat ty, kteří jsou ohroženi odchodem.
Aby analytici z HR tuto nerovnováhu napravili, používají syntetický resampling a vytvářejí více případů „odcházím", čímž data vyvažují.
Klíčový požadavek: model by neměl mylně označovat loajální zaměstnance jako „vysoce rizikové", aby nedocházelo ke zbytečnému vynakládání udržovacích opatření.
Model se hodnotí pomocí těchto metrik:
- Trénovací přesnost: správné předpovědi na trénovacích datech.
- Testovací přesnost: správné předpovědi na nových datech.
- Precision: kolik z předpovězených „odchodů" skutečně nastalo.
| Metrika | Model A (bez resamplingу) | Model B (s resamplingem) |
|---|---|---|
| Trénovací přesnost | 85 % | 95 % |
| Testovací přesnost | 82 % | 85 % |
| Precision | 80 % | 68 % |
Toto cvičení je součástí kurzu
Pokročilá pravděpodobnost: neurčitost v datech
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení