Tinh chỉnh siêu tham số cho bagging
Bạn có thể dễ dàng xây dựng một bộ phân loại bagging với các tham số mặc định, nhưng rất nên tinh chỉnh chúng để đạt hiệu năng tối ưu. Lý tưởng nhất, bạn nên tối ưu bằng K-fold cross-validation.
Trong bài tập này, hãy thử cải thiện hiệu năng mô hình bằng cách thay đổi các tham số của bộ phân loại bagging.
Ở đây, chúng ta cũng truyền tham số solver='liblinear' cho LogisticRegression để giảm thời gian tính toán.
Bài tập này là một phần của khóa học
Ensemble Methods in Python
Hướng dẫn bài tập
- Xây dựng một bộ phân loại bagging dùng logistic regression làm mô hình cơ sở, với
20bộ ước lượng cơ sở,10số đặc trưng tối đa,0.65(65%) số mẫu tối đa (max_samples), và lấy mẫu KHÔNG hoàn lại. - Dùng
clf_bagđể dự đoán nhãn cho tập kiểm traX_test.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Build a balanced logistic regression
clf_base = LogisticRegression(class_weight='balanced', solver='liblinear', random_state=42)
# Build and fit a bagging classifier with custom parameters
clf_bag = ____(____, ____, ____, ____, ____, random_state=500)
clf_bag.fit(X_train, y_train)
# Calculate predictions and evaluate the accuracy on the test set
y_pred = ____
print('Accuracy: {:.2f}'.format(accuracy_score(y_test, y_pred)))
# Print the classification report
print(classification_report(y_test, y_pred))