Bắt đầu ngayBắt đầu miễn phí

Phát triển và kiểm thử mô hình tốt nhất

Trong Chương 3, bạn phát hiện các tham số sau giúp mô hình tốt hơn:

  • max_depth = 8,
  • min_samples_leaf = 150,
  • class_weight = "balanced"

Ở chương này, bạn thấy rằng một số đặc trưng có tác động không đáng kể. Bạn nhận ra rằng có thể dự đoán chính xác chỉ với một số ít đặc trưng được chọn có ảnh hưởng mạnh và đã cập nhật tập huấn luyện và kiểm tra tương ứng, tạo ra các biến features_train_selectedfeatures_test_selected.

Với tất cả thông tin này, giờ bạn sẽ xây dựng mô hình tốt nhất để dự đoán nghỉ việc của nhân viên và đánh giá nó bằng các thước đo phù hợp.

Các biến features_train_selectedfeatures_test_selected đã có sẵn trong môi trường làm việc của bạn, và các hàm recall_scoreroc_auc_score đã được import sẵn.

Bài tập này là một phần của khóa học

Phân tích Nhân sự (HR Analytics): Dự đoán nghỉ việc bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo mô hình tốt nhất bằng các tham số trong phần mô tả.
  • Fit mô hình chỉ với các đặc trưng đã chọn từ tập huấn luyện.
  • Dự đoán dựa trên các đặc trưng đã chọn từ tập kiểm tra.
  • In ra độ chính xác, recall và điểm ROC/AUC của mô hình.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Initialize the best model using parameters provided in description
model_best = DecisionTreeClassifier(____=____, ____=____, ____=____, random_state=42)

# Fit the model using only selected features from training set: done
model_best.fit(____, target_train)

# Make prediction based on selected list of features from test set
prediction_best = model_best.____(____)

# Print the general accuracy of the model_best
print(____.score(features_test_selected, target_test) * 100)

# Print the recall score of the model predictions
print(____(target_test, prediction_best) * 100)

# Print the ROC/AUC score of the model predictions
print(roc_auc_score(target_test, ____) * 100)
Chỉnh sửa và Chạy Mã