การแลกเปลี่ยนของการรีแซมปลิง
บริษัทเทคโนโลยีขนาดใหญ่แห่งหนึ่งต้องการ พยากรณ์การลาออกของพนักงาน เพื่อปรับปรุงการรักษาบุคลากร แต่มีพนักงานเพียง 12% เท่านั้นที่เคยลาออก ทำให้โมเดลถูกฝึกด้วยข้อมูลกลุ่ม "อยู่ต่อ" เป็นส่วนใหญ่ (88%) ส่งผลให้ตรวจจับผู้ที่เสี่ยงจะลาออกได้ยาก
เพื่อแก้ปัญหาความไม่สมดุลนี้ นักวิเคราะห์ฝ่าย HR จึงใช้ synthetic resampling เพื่อสร้างข้อมูลกลุ่ม "ลาออก" เพิ่มขึ้นและทำให้ข้อมูลสมดุลขึ้น
ข้อกำหนดสำคัญ: โมเดลควรหลีกเลี่ยงการจัดพนักงานที่ภักดีต่อองค์กรให้เป็น "ผู้เสี่ยงลาออก" โดยผิดพลาด เพื่อไม่ให้ทรัพยากรในการรักษาพนักงานสูญเปล่า
โมเดลถูกประเมินด้วยตัวชี้วัดดังนี้:
- Training accuracy: ความแม่นยำในการพยากรณ์บนข้อมูลฝึก
- Test accuracy: ความแม่นยำในการพยากรณ์บนข้อมูลใหม่
- Precision: สัดส่วนของผู้ที่ถูกพยากรณ์ว่าจะลาออกแล้วลาออกจริง
| ตัวชี้วัด | โมเดล A (ไม่ใช้ resampling) | โมเดล B (ใช้ resampling) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความน่าจะเป็นขั้นสูง: ความไม่แน่นอนในข้อมูล
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด