Dự đoán churn với cây quyết định
Bây giờ, bạn sẽ tiếp tục từ kỹ năng đã học ở bài trước và xây dựng một cây quyết định phức tạp hơn với các tham số bổ sung để dự đoán việc khách hàng rời bỏ (churn). Bạn sẽ đi sâu vào bài toán dự đoán churn ở chương kế tiếp. Ở đây, bạn sẽ chạy lại bộ phân loại cây quyết định trên dữ liệu huấn luyện, dự đoán tỷ lệ churn trên dữ liệu chưa thấy (kiểm tra), và đánh giá độ chính xác của mô hình trên cả hai tập dữ liệu.
Mô-đun tree từ thư viện sklearn đã được nạp sẵn cho bạn, cùng với hàm accuracy_score từ sklearn.metrics. Các biến đặc trưng và mục tiêu cũng đã được nhập dưới dạng train_X, train_Y cho dữ liệu huấn luyện, và test_X, test_Y cho dữ liệu kiểm tra.
Bài tập này là một phần của khóa học
Machine Learning cho Marketing với Python
Hướng dẫn bài tập
- Khởi tạo một cây quyết định với độ sâu tối đa là 7 và dùng tiêu chí gini.
- Fit mô hình với dữ liệu huấn luyện.
- Dự đoán giá trị trên tập dữ liệu kiểm tra.
- In ra độ chính xác cho cả hai tập dữ liệu huấn luyện và kiểm tra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))