始める無料で始める

リサンプリングのトレードオフ

大手テック企業が、離職防止のために従業員の離職を予測したいと考えています。ただし、これまでに離職したのは全体の12%のみで、学習データの大半は「在籍」(88%)です。そのため、離職リスクの高い従業員を見つけにくい状況です。

この不均衡を是正するために、人事アナリストは合成リサンプリングを用いて「離職」ケースを増やし、データのバランスを取ります。

重要な要件:忠実な従業員を「高リスクの離職予備群」と誤分類しないこと。無駄なリテンション施策を避けるためです。

モデルは以下で評価します:

  • Training accuracy:学習データに対する正解率。
  • Test accuracy:新しいデータに対する正解率。
  • Precision:離職と予測したうち、実際に離職した割合。
Metric Model A (without resampling) Model B (with resampling)
Training accuracy 85% 95%
Test Accuracy 82% 85%
Precision 80% 68%

この演習はコースの一部です

Advanced Probability: データの不確実性

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する