Ngưỡng mặc định
Bạn muốn xác nhận rằng DecisionTreeClassifier() dùng cùng một ngưỡng phân loại mặc định như đã đề cập ở bài trước, cụ thể là 0.5. Việc tất cả classifier đều dùng cùng một ngưỡng nghe có vẻ lạ. Hãy kiểm tra! Một bộ phân loại cây quyết định đã được huấn luyện clf đã được nạp sẵn cho bạn, cùng với dữ liệu huấn luyện và kiểm tra với các tên quen thuộc: X_train, X_test, y_train và y_test. Bạn sẽ cần trích xuất xác suất từ bộ phân loại bằng phương thức .predict_proba().
Bài tập này là một phần của khóa học
Thiết kế quy trình Machine Learning bằng Python
Hướng dẫn bài tập
- Tạo điểm số cho các mẫu kiểm tra bằng bộ phân loại
clfđã nạp sẵn. - Bây giờ trích xuất nhãn từ các điểm số. Hãy nhớ rằng bạn có một cặp điểm số cho mỗi mẫu, không phải một điểm số duy nhất, và phần tử thứ hai là xác suất của lớp dương.
- Tiếp theo, gán nhãn cho dữ liệu kiểm tra bằng phương thức chuẩn
.predict() - Cuối cùng, so sánh với các dự đoán bạn có trước đó. Chúng có giống hệt nhau không?
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Score the test data using the given classifier
scores = clf.____(____)
# Get labels from the scores using the default threshold
preds = [s[____] > ____ for s in scores]
# Use the predict method to label the test data again
preds_default = clf.____(____)
# Compare the two sets of predictions
____(preds == preds_default)