开始使用免费开始使用

重采样的权衡

一家大型科技公司希望预测员工流失以提升留任率。但只有 12% 的员工已经离职,模型在训练时主要看到的是"留任"样本(88%),这使得识别有离职风险的员工变得困难。

为纠正这种不平衡,人力分析师使用合成重采样来增加"离职"样本,从而平衡数据。

一个关键要求:模型应尽量避免把忠诚员工误判为"高风险离职者",以免造成不必要的留任干预成本。

模型使用以下指标进行评估:

  • 训练准确率:在训练数据上的正确预测比例。
  • 测试准确率:在新数据上的正确预测比例。
  • 精确率(Precision):被预测为离职的员工中,实际离职的比例。
指标 模型 A(未重采样) 模型 B(已重采样)
Training accuracy 85% 95%
Test Accuracy 82% 85%
Precision 80% 68%

本练习是课程的一部分

Advanced Probability: 数据中的不确定性

查看课程

动手互动练习

通过我们的互动练习之一,将理论转化为实践

开始练习