重取樣的取捨
一家大型科技公司想要預測員工流失以提升留任率。但只有 12% 的員工離職,模型主要是用「留下」的案例(88%)來訓練,因此很難辨識有離職風險的人。
為了修正這個不平衡,人資分析師使用合成重取樣來建立更多「離職」案例,使資料更平衡。
一項關鍵需求:模型應避免把忠誠員工誤判為「高風險離職者」,以免浪費留任資源。
模型以以下指標評估:
- 訓練正確率(Training accuracy):在訓練資料上的正確預測比例。
- 測試正確率(Test accuracy):在新資料上的正確預測比例。
- 精確率(Precision):被預測為離職者中,實際離職的比例。
| Metric | Model A (without resampling) | Model B (with resampling) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
本練習屬於課程
