重采样的权衡
一家大型科技公司希望预测员工流失以提升留任率。但只有 12% 的员工已经离职,模型在训练时主要看到的是"留任"样本(88%),这使得识别有离职风险的员工变得困难。
为纠正这种不平衡,人力分析师使用合成重采样来增加"离职"样本,从而平衡数据。
一个关键要求:模型应尽量避免把忠诚员工误判为"高风险离职者",以免造成不必要的留任干预成本。
模型使用以下指标进行评估:
- 训练准确率:在训练数据上的正确预测比例。
- 测试准确率:在新数据上的正确预测比例。
- 精确率(Precision):被预测为离职的员工中,实际离职的比例。
| 指标 | 模型 A(未重采样) | 模型 B(已重采样) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
本练习是课程的一部分
