Resampling का समझौता (trade-off)
एक बड़ी टेक कंपनी कर्मचारी attrition का पूर्वानुमान लगाकर retention बेहतर करना चाहती है। लेकिन केवल 12% कर्मचारी ही छोड़े हैं, इसलिए मॉडल ज्यादातर "stay" मामलों (88%) पर प्रशिक्षित है, जिससे जो कर्मचारी छोड़ने के जोखिम पर हैं उन्हें पहचानना कठिन हो जाता है।
इस असंतुलन को ठीक करने के लिए, HR विश्लेषक synthetic resampling का उपयोग करके अधिक "leave" मामलों का सृजन करते हैं और डेटा को संतुलित करते हैं।
एक मुख्य आवश्यकता: मॉडल वफादार कर्मचारियों को "उच्च-जोखिम छोड़ने वाले" के रूप में गलत वर्गीकृत करने से बचे, ताकि retention प्रयास व्यर्थ न हों।
मॉडल का मूल्यांकन इनसे किया जाता है:
- Training accuracy: प्रशिक्षण डेटा पर सही भविष्यवाणियाँ।
- Test accuracy: नए डेटा पर सही भविष्यवाणियाँ।
- Precision: जितनों को छोड़ने वाला बताया गया, उनमें से वास्तव में कितने छोड़े।
| Metric | Model A (बिना resampling) | Model B (resampling के साथ) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
यह अभ्यास पाठ्यक्रम का हिस्सा है
एडवांस्ड Probability: डेटा में अनिश्चितता
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें