リサンプリングのトレードオフ
大手テック企業が、離職防止のために従業員の離職を予測したいと考えています。ただし、これまでに離職したのは全体の12%のみで、学習データの大半は「在籍」(88%)です。そのため、離職リスクの高い従業員を見つけにくい状況です。
この不均衡を是正するために、人事アナリストは合成リサンプリングを用いて「離職」ケースを増やし、データのバランスを取ります。
重要な要件:忠実な従業員を「高リスクの離職予備群」と誤分類しないこと。無駄なリテンション施策を避けるためです。
モデルは以下で評価します:
- Training accuracy:学習データに対する正解率。
- Test accuracy:新しいデータに対する正解率。
- Precision:離職と予測したうち、実際に離職した割合。
| Metric | Model A (without resampling) | Model B (with resampling) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
この演習はコースの一部です
