開始使用免費開始

重取樣的取捨

一家大型科技公司想要預測員工流失以提升留任率。但只有 12% 的員工離職,模型主要是用「留下」的案例(88%)來訓練,因此很難辨識有離職風險的人。

為了修正這個不平衡,人資分析師使用合成重取樣來建立更多「離職」案例,使資料更平衡。

一項關鍵需求:模型應避免把忠誠員工誤判為「高風險離職者」,以免浪費留任資源。

模型以以下指標評估:

  • 訓練正確率(Training accuracy):在訓練資料上的正確預測比例。
  • 測試正確率(Test accuracy):在新資料上的正確預測比例。
  • 精確率(Precision):被預測為離職者中,實際離職的比例。
Metric Model A (without resampling) Model B (with resampling)
Training accuracy 85% 95%
Test Accuracy 82% 85%
Precision 80% 68%

本練習屬於課程

Advanced Probability: Uncertainty in Data

檢視課程

動手互動練習

將理論付諸實踐,立即體驗我們的互動練習

開始練習