Đánh đổi khi tái lấy mẫu
Một công ty công nghệ lớn muốn dự đoán tỷ lệ nghỉ việc của nhân viên để cải thiện giữ chân. Nhưng chỉ 12% nhân viên đã nghỉ, nên mô hình chủ yếu được huấn luyện trên các ca "ở lại" (88%), khiến việc phát hiện người có nguy cơ nghỉ việc trở nên khó khăn.
Để khắc phục mất cân bằng này, các nhà phân tích nhân sự sử dụng tái lấy mẫu tổng hợp để tạo thêm các ca "nghỉ việc" và cân bằng dữ liệu.
Một yêu cầu then chốt: mô hình nên tránh phân loại sai nhân viên trung thành thành "nguy cơ nghỉ việc cao" để không lãng phí nỗ lực giữ chân.
Mô hình được đánh giá bằng:
- Training accuracy: tỷ lệ dự đoán đúng trên dữ liệu huấn luyện.
- Test accuracy: tỷ lệ dự đoán đúng trên dữ liệu mới.
- Precision: trong số những người được dự đoán nghỉ việc, có bao nhiêu người thực sự đã nghỉ.
| Metric | Model A (không tái lấy mẫu) | Model B (có tái lấy mẫu) |
|---|---|---|
| Training accuracy | 85% | 95% |
| Test Accuracy | 82% | 85% |
| Precision | 80% | 68% |
Bài tập này là một phần của khóa học
Xác suất nâng cao: Bất định trong dữ liệu
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập