Bắt đầu ngayBắt đầu miễn phí

Xây dựng bộ phân loại bệnh tiểu đường

Bạn sẽ dùng bộ dữ liệu Pima Indians diabetes để dự đoán một người có mắc tiểu đường hay không bằng logistic regression. Bộ dữ liệu có 8 đặc trưng và một mục tiêu. Dữ liệu đã được chia thành tập huấn luyện và kiểm tra, và đã được nạp sẵn dưới dạng X_train, y_train, X_test, và y_test.

Một thực thể StandardScaler() đã được định nghĩa sẵn là scaler và một thực thể LogisticRegression()lr.

Bài tập này là một phần của khóa học

Giảm Chiều Dữ Liệu với Python

Xem khóa học

Hướng dẫn bài tập

  • Fit bộ chuẩn hóa trên các đặc trưng huấn luyện và transform các đặc trưng này trong một lần.
  • Fit mô hình logistic regression trên dữ liệu huấn luyện đã chuẩn hóa.
  • Chuẩn hóa (scale) các đặc trưng của tập kiểm tra.
  • Dự đoán sự hiện diện của tiểu đường trên tập kiểm tra đã chuẩn hóa.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Fit the scaler on the training features and transform these in one go
X_train_std = scaler.____(____)

# Fit the logistic regression model on the scaled training data
lr.____(____, ____)

# Scale the test features
X_test_std = scaler.____(____)

# Predict diabetes presence on the scaled test set
y_pred = lr.____(____)

# Prints accuracy metrics and feature coefficients
print(f"{accuracy_score(y_test, y_pred):.1%} accuracy on test set.")
print(dict(zip(X.columns, abs(lr.coef_[0]).round(2))))
Chỉnh sửa và Chạy Mã