Yeniden örnekleme ödünleşimi
Büyük bir teknoloji şirketi, elde tutmayı iyileştirmek için çalışan ayrılmasını tahmin etmek istiyor. Ancak çalışanların sadece %12'si ayrılmış; model ağırlıklı olarak "kal" vakaları (%88) üzerinde eğitiliyor ve bu da ayrılma riski taşıyanları tespit etmeyi zorlaştırıyor.
Bu dengesizliği gidermek için İK analistleri, veriyi dengelemek adına daha fazla "ayrılma" vakası oluşturmak için sentetik yeniden örnekleme kullanıyor.
Bir temel gereksinim: model, sadık çalışanları "yüksek riskli ayrılacak" olarak yanlış sınıflamaktan kaçınmalı; böylece gereksiz elde tutma çabaları önlenmeli.
Model şu metriklerle değerlendiriliyor:
- Eğitim doğruluğu (training accuracy): eğitim verisindeki doğru tahminler.
- Test doğruluğu (test accuracy): yeni verideki doğru tahminler.
- Hassasiyet (precision): ayrılacağı tahmin edilenlerin kaçının gerçekten ayrıldığı.
| Metric | Model A (yeniden örnekleme yok) | Model B (yeniden örnekleme var) |
|---|---|---|
| Training accuracy | %85 | %95 |
| Test Accuracy | %82 | %85 |
| Precision | %80 | %68 |
Bu egzersiz, kursun bir parçasıdır
İleri Olasılık: Veride Belirsizlik
Uygulamalı etkileşimli egzersiz
Teoriyi etkileşime dönüştürün, interaktif egzersizlerimizden biriyle
Egzersize başla