Bắt đầu ngayBắt đầu miễn phí

Đánh giá bộ phân loại dự đoán bệnh tiểu đường

Trong chương này bạn sẽ làm việc với bộ dữ liệu diabetes_df đã được giới thiệu trước đó.

Mục tiêu là dự đoán liệu mỗi cá nhân có khả năng mắc bệnh tiểu đường hay không dựa trên các đặc trưng chỉ số khối cơ thể (BMI) và tuổi (tính bằng năm). Vì vậy, đây là một bài toán phân loại nhị phân. Giá trị đích 0 cho biết cá nhân không mắc bệnh tiểu đường, trong khi giá trị 1 cho biết cá nhân mắc bệnh tiểu đường.

diabetes_df đã được nạp sẵn dưới dạng pandas DataFrame và tách thành X_train, X_test, y_trainy_test. Ngoài ra, một KNeighborsClassifier() đã được khởi tạo và gán cho knn.

Bạn sẽ huấn luyện mô hình, tạo dự đoán trên tập kiểm tra, sau đó tạo ma trận nhầm lẫn và báo cáo phân loại.

Bài tập này là một phần của khóa học

Học có giám sát với scikit-learn

Xem khóa học

Hướng dẫn bài tập

  • Import confusion_matrixclassification_report.
  • Fit mô hình với dữ liệu huấn luyện.
  • Dự đoán nhãn của tập kiểm tra và lưu kết quả vào y_pred.
  • Tính và in ra ma trận nhầm lẫn và báo cáo phân loại cho nhãn kiểm tra so với nhãn dự đoán.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import confusion matrix
____

knn = KNeighborsClassifier(n_neighbors=6)

# Fit the model to the training data
____

# Predict the labels of the test data: y_pred
y_pred = ____

# Generate the confusion matrix and classification report
print(____(____, ____))
print(____(____, ____))
Chỉnh sửa và Chạy Mã