Đường cơ sở (Baseline)
Đánh giá một bộ phân loại so với một đường cơ sở phù hợp là rất quan trọng. Điều này càng đúng với các tập dữ liệu mất cân bằng, như click quảng cáo, vì độ chính xác (accuracy) cao có thể dễ dàng đạt được bằng cách luôn chọn lớp chiếm đa số. Trong bài này, bạn sẽ mô phỏng một bộ phân loại đường cơ sở luôn dự đoán lớp chiếm đa số (không click) và xem ma trận nhầm lẫn (confusion matrix) của nó, cũng như precision và recall của nó.
X_train, y_train, X_test, y_test đã có sẵn trong workspace của bạn. pandas là pd, numpy là np, và sklearn cũng đã sẵn sàng trong workspace.
Bài tập này là một phần của khóa học
Dự đoán CTR với Machine Learning trong Python
Hướng dẫn bài tập
- Tạo
y_predlà một mảng toàn số 0 có cùng độ dài vớiX_testbằngnp.asarray(). - In ma trận nhầm lẫn thu được.
- Lấy điểm precision và recall.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set up baseline predictions
y_pred = np.____([0 for x in range(len(X_test))])
# Look at confusion matrix
print("Confusion matrix: ")
print(____(y_test, y_pred))
# Check precision and recall
prec = ____(y_test, y_pred, average = 'weighted')
recall = ____(y_test, y_pred, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))