Tính accuracy
Sau khi đã chia dữ liệu thành tập huấn luyện và tập kiểm tra, bạn có thể huấn luyện mô hình trên dữ liệu training và sau đó dự đoán nhãn cho dữ liệu test. Đây chính là những gì bạn sẽ thực hành trong bài này.
Đến giờ, bạn đã dùng Logistic Regression và Decision Trees. Ở đây, bạn sẽ dùng RandomForestClassifier, có thể hiểu là một tập hợp (ensemble) của nhiều Decision Trees và thường cho hiệu suất tốt hơn một Decision Tree đơn lẻ.
Kết quả từ các bài trước đã được giữ lại, và các tập huấn luyện/kiểm tra có sẵn trong các biến X_train, X_test, y_train, và y_test.
Bài tập này là một phần của khóa học
Phân tích Marketing: Dự đoán Khách hàng Rời bỏ bằng Python
Hướng dẫn bài tập
- Import
RandomForestClassifiertừsklearn.ensemble. - Khởi tạo một
RandomForestClassifiervà gán vàoclf. - Huấn luyện
clfvới dữ liệu huấn luyện:X_trainvày_train. - Tính accuracy của
clftrên dữ liệu kiểm tra bằng phương thức.score().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import RandomForestClassifier
# Instantiate the classifier
clf = ____
# Fit to the training data
# Compute accuracy
print(____.____(____, ____))