Bắt đầu ngayBắt đầu miễn phí

Đánh đổi khi tái lấy mẫu

Một công ty công nghệ lớn muốn dự đoán tỷ lệ nghỉ việc của nhân viên để cải thiện giữ chân. Nhưng chỉ 12% nhân viên đã nghỉ, nên mô hình chủ yếu được huấn luyện trên các ca "ở lại" (88%), khiến việc phát hiện người có nguy cơ nghỉ việc trở nên khó khăn.

Để khắc phục mất cân bằng này, các nhà phân tích nhân sự sử dụng tái lấy mẫu tổng hợp để tạo thêm các ca "nghỉ việc" và cân bằng dữ liệu.

Một yêu cầu then chốt: mô hình nên tránh phân loại sai nhân viên trung thành thành "nguy cơ nghỉ việc cao" để không lãng phí nỗ lực giữ chân.

Mô hình được đánh giá bằng:

  • Training accuracy: tỷ lệ dự đoán đúng trên dữ liệu huấn luyện.
  • Test accuracy: tỷ lệ dự đoán đúng trên dữ liệu mới.
  • Precision: trong số những người được dự đoán nghỉ việc, có bao nhiêu người thực sự đã nghỉ.
Metric Model A (không tái lấy mẫu) Model B (có tái lấy mẫu)
Training accuracy 85% 95%
Test Accuracy 82% 85%
Precision 80% 68%

Bài tập này là một phần của khóa học

Xác suất nâng cao: Bất định trong dữ liệu

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập