Đánh giá bộ phân loại dự đoán bệnh tiểu đường
Trong chương này bạn sẽ làm việc với bộ dữ liệu diabetes_df đã được giới thiệu trước đó.
Mục tiêu là dự đoán liệu mỗi cá nhân có khả năng mắc bệnh tiểu đường hay không dựa trên các đặc trưng chỉ số khối cơ thể (BMI) và tuổi (tính bằng năm). Vì vậy, đây là một bài toán phân loại nhị phân. Giá trị đích 0 cho biết cá nhân không mắc bệnh tiểu đường, trong khi giá trị 1 cho biết cá nhân có mắc bệnh tiểu đường.
diabetes_df đã được nạp sẵn dưới dạng pandas DataFrame và tách thành X_train, X_test, y_train và y_test. Ngoài ra, một KNeighborsClassifier() đã được khởi tạo và gán cho knn.
Bạn sẽ huấn luyện mô hình, tạo dự đoán trên tập kiểm tra, sau đó tạo ma trận nhầm lẫn và báo cáo phân loại.
Bài tập này là một phần của khóa học
Học có giám sát với scikit-learn
Hướng dẫn bài tập
- Import
confusion_matrixvàclassification_report. - Fit mô hình với dữ liệu huấn luyện.
- Dự đoán nhãn của tập kiểm tra và lưu kết quả vào
y_pred. - Tính và in ra ma trận nhầm lẫn và báo cáo phân loại cho nhãn kiểm tra so với nhãn dự đoán.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import confusion matrix
____
knn = KNeighborsClassifier(n_neighbors=6)
# Fit the model to the training data
____
# Predict the labels of the test data: y_pred
y_pred = ____
# Generate the confusion matrix and classification report
print(____(____, ____))
print(____(____, ____))