Đánh giá bốn loại kết quả
Ma trận nhầm lẫn là công cụ trực quan nhất để xem bốn loại kết quả: true positives (TP), false positives (FP), true negatives (TN), và false negatives (FN). Trong bài tập này, bạn sẽ dùng bộ phân loại cây quyết định tiêu chuẩn DecisionTreeClassifier() từ sklearn trên dữ liệu click mẫu và tính các phân tách kết quả theo bốn loại.
Mô-đun pandas đã có sẵn với bí danh pd trong không gian làm việc và DataFrame mẫu đã được nạp dưới tên df. Các đặc trưng đã được nạp vào X và mục tiêu đã được nạp vào y để sử dụng. Ngoài ra, DecisionTreeClassifier từ sklearn.tree cũng sẵn có.
Bài tập này là một phần của khóa học
Dự đoán CTR với Machine Learning trong Python
Hướng dẫn bài tập
- Tạo các tập huấn luyện và kiểm tra cho
Xvày. - Định nghĩa một bộ phân loại cây quyết định và tạo dự đoán
y_predbằng cách fit mô hình. - Dùng ma trận nhầm lẫn để lấy số đếm cho từng loại kết quả, với
1là dương (click) và0là âm (không click). - Ví dụ: true negatives là
[0,0]và true positives là[1,1].
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test)
# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]
print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))