Xây dựng bộ phân loại bệnh tiểu đường
Bạn sẽ dùng bộ dữ liệu Pima Indians diabetes để dự đoán một người có mắc tiểu đường hay không bằng logistic regression. Bộ dữ liệu có 8 đặc trưng và một mục tiêu. Dữ liệu đã được chia thành tập huấn luyện và kiểm tra, và đã được nạp sẵn dưới dạng X_train, y_train, X_test, và y_test.
Một thực thể StandardScaler() đã được định nghĩa sẵn là scaler và một thực thể LogisticRegression() là lr.
Bài tập này là một phần của khóa học
Giảm Chiều Dữ Liệu với Python
Hướng dẫn bài tập
- Fit bộ chuẩn hóa trên các đặc trưng huấn luyện và transform các đặc trưng này trong một lần.
- Fit mô hình logistic regression trên dữ liệu huấn luyện đã chuẩn hóa.
- Chuẩn hóa (scale) các đặc trưng của tập kiểm tra.
- Dự đoán sự hiện diện của tiểu đường trên tập kiểm tra đã chuẩn hóa.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Fit the scaler on the training features and transform these in one go
X_train_std = scaler.____(____)
# Fit the logistic regression model on the scaled training data
lr.____(____, ____)
# Scale the test features
X_test_std = scaler.____(____)
# Predict diabetes presence on the scaled test set
y_pred = lr.____(____)
# Prints accuracy metrics and feature coefficients
print(f"{accuracy_score(y_test, y_pred):.1%} accuracy on test set.")
print(dict(zip(X.columns, abs(lr.coef_[0]).round(2))))