เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแลกเปลี่ยนของการรีแซมปลิง

บริษัทเทคโนโลยีขนาดใหญ่แห่งหนึ่งต้องการ พยากรณ์การลาออกของพนักงาน เพื่อปรับปรุงการรักษาบุคลากร แต่มีพนักงานเพียง 12% เท่านั้นที่เคยลาออก ทำให้โมเดลถูกฝึกด้วยข้อมูลกลุ่ม "อยู่ต่อ" เป็นส่วนใหญ่ (88%) ส่งผลให้ตรวจจับผู้ที่เสี่ยงจะลาออกได้ยาก

เพื่อแก้ปัญหาความไม่สมดุลนี้ นักวิเคราะห์ฝ่าย HR จึงใช้ synthetic resampling เพื่อสร้างข้อมูลกลุ่ม "ลาออก" เพิ่มขึ้นและทำให้ข้อมูลสมดุลขึ้น

ข้อกำหนดสำคัญ: โมเดลควรหลีกเลี่ยงการจัดพนักงานที่ภักดีต่อองค์กรให้เป็น "ผู้เสี่ยงลาออก" โดยผิดพลาด เพื่อไม่ให้ทรัพยากรในการรักษาพนักงานสูญเปล่า

โมเดลถูกประเมินด้วยตัวชี้วัดดังนี้:

  • Training accuracy: ความแม่นยำในการพยากรณ์บนข้อมูลฝึก
  • Test accuracy: ความแม่นยำในการพยากรณ์บนข้อมูลใหม่
  • Precision: สัดส่วนของผู้ที่ถูกพยากรณ์ว่าจะลาออกแล้วลาออกจริง
ตัวชี้วัด โมเดล A (ไม่ใช้ resampling) โมเดล B (ใช้ resampling)
Training accuracy 85% 95%
Test Accuracy 82% 85%
Precision 80% 68%

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ความน่าจะเป็นขั้นสูง: ความไม่แน่นอนในข้อมูล

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง

เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา

เริ่มแบบฝึกหัด