Huấn luyện cây phân loại đầu tiên của bạn
Trong bài tập này, bạn sẽ làm việc với Wisconsin Breast Cancer Dataset từ kho UCI machine learning. Bạn sẽ dự đoán liệu một khối u là ác tính hay lành tính dựa trên hai đặc trưng: bán kính trung bình của khối u (radius_mean) và số điểm lõm trung bình (concave points_mean).
Bộ dữ liệu đã được nạp sẵn vào không gian làm việc của bạn và được chia thành 80% huấn luyện và 20% kiểm tra. Ma trận đặc trưng được gán cho X_train và X_test, trong khi các mảng nhãn được gán cho y_train và y_test, trong đó lớp 1 tương ứng với khối u ác tính và lớp 0 tương ứng với khối u lành tính. Để có kết quả có thể tái lập, chúng tôi cũng đã định nghĩa một biến SEED với giá trị 1.
Bài tập này là một phần của khóa học
Machine Learning với mô hình dựa trên cây trong Python
Hướng dẫn bài tập
Import
DecisionTreeClassifiertừsklearn.tree.Khởi tạo một
DecisionTreeClassifierdtvới độ sâu tối đa bằng 6.Fit
dtvào tập huấn luyện.Dự đoán nhãn của tập kiểm tra và gán kết quả cho
y_pred.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____
# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)
# Fit dt to the training set
____.____(____, ____)
# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])