Khám phá các siêu tham số của Random Forest
Hiểu rõ các siêu tham số hiện có và tác động của từng siêu tham số là kỹ năng cốt lõi với mọi data scientist. Khi mô hình trở nên phức tạp hơn, có rất nhiều thiết lập bạn có thể chỉnh, nhưng chỉ một vài trong số đó thực sự ảnh hưởng lớn đến mô hình.
Bây giờ bạn sẽ đánh giá một mô hình random forest hiện có (mô hình này đang dùng một số siêu tham số chưa hợp lý!) rồi đưa ra lựa chọn tốt hơn cho một mô hình random forest mới và đánh giá hiệu năng của nó.
Bạn sẽ có sẵn:
- Các DataFrame
X_train,X_test,y_train,y_test - Một bộ ước lượng random forest đã được huấn luyện trước,
rf_clf_old - Dự đoán của bộ ước lượng random forest hiện có trên tập kiểm tra,
rf_old_predictions
Bài tập này là một phần của khóa học
Tinh chỉnh siêu tham số trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print out the old estimator, notice which hyperparameter is badly set
print(____)
# Get confusion matrix & accuracy for the old rf_model
print("Confusion Matrix: \n\n {} \n Accuracy Score: \n\n {}".format(
confusion_matrix(____, ____),
accuracy_score(____, ____)))