Bắt đầu ngayBắt đầu miễn phí

Hồi quy logistic cho ung thư vú

Ở bài trước, bạn đã có đánh giá sơ bộ về dữ liệu. Trong bài này, bạn sẽ định nghĩa tập huấn luyện và kiểm tra cho một mô hình hồi quy logistic trên bộ dữ liệu ung thư vú. Đây là bước đầu tiên quan trọng trước khi chạy mọi mô hình Machine Learning.

Bộ dữ liệu ung thư vú là một mẫu từ sklearn với nhiều đặc trưng của bệnh nhân và biến mục tiêu cho biết bệnh nhân có ung thư vú hay không. Dữ liệu có dạng dictionary, trong đó dữ liệu chính nằm trong mảng data, và các giá trị mục tiêu nằm trong mảng target. Do đó, cancer_data.data sẽ là các đặc trưng và cancer_data.target là các nhãn mục tiêu. Dữ liệu mẫu đã được nạp vào biến cancer_data, cùng với pandaspd. LogisticRegression có sẵn qua sklearn.linear_model.

Bài tập này là một phần của khóa học

Dự đoán CTR với Machine Learning trong Python

Xem khóa học

Hướng dẫn bài tập

  • Định nghĩa Xy lần lượt từ datatarget.
  • Tạo X_trainy_train từ 300 mẫu đầu tiên của Xy, lần lượt, dùng X[:300] cho X_train.
  • Tạo X_testy_test từ phần còn lại của Xy (không bao gồm 300 mẫu đầu), dùng X[300:] cho X_test.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Define X and y 
X = cancer_data.____
y = cancer_data.____

# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____] 
Chỉnh sửa và Chạy Mã