Tổng hợp mọi thứ
Đến lúc tổng hợp tất cả những gì bạn đã học! Ở bài tập cuối cùng của khóa học này, bạn sẽ kết hợp phần việc từ các bài trước thành một pipeline XGBoost end-to-end để củng cố hiểu biết về tiền xử lý và pipelines trong XGBoost.
Phần tiền xử lý dữ liệu và thiết lập pipeline từ 3 bài tập trước đã được nạp sẵn. Nhiệm vụ của bạn là thực hiện randomized search và xác định các siêu tham số (hyperparameters) tốt nhất.
Bài tập này là một phần của khóa học
Gradient Boosting Cực Mạnh với XGBoost
Hướng dẫn bài tập
- Thiết lập lưới tham số để tinh chỉnh
'clf__learning_rate'(từ0.05đến1với bước0.05),'clf__max_depth'(từ3đến10với bước1), và'clf__n_estimators'(từ50đến200với bước50). - Dùng
pipelinelàm estimator, thực hiệnRandomizedSearchCV2-fold vớin_iterbằng2. Dùng"roc_auc"làm thước đo, và đặtverboselà1để đầu ra chi tiết hơn. Lưu kết quả vàorandomized_roc_auc. - Fit
randomized_roc_aucvớiXvày. - Tính điểm số tốt nhất và mô hình tốt nhất của
randomized_roc_auc.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create the parameter grid
gbm_param_grid = {
'____': ____(____, ____, ____),
'____': ____(____, ____, ____),
'____': ____(____, ____, ____)
}
# Perform RandomizedSearchCV
randomized_roc_auc = ____
# Fit the estimator
____
# Compute metrics
print(____)
print(____)