Bộ phân loại Rừng ngẫu nhiên - phần 1
Giờ hãy tạo bộ phân loại rừng ngẫu nhiên đầu tiên để phát hiện gian lận. Hy vọng bạn có thể làm tốt hơn độ chính xác cơ bản mà bạn vừa tính được, khoảng 96%. Mô hình này sẽ đóng vai trò mô hình “baseline” mà bạn sẽ cố gắng cải thiện trong các bài tập tiếp theo. Bắt đầu bằng việc chia dữ liệu thành tập huấn luyện và tập kiểm tra, và định nghĩa mô hình Random Forest. Dữ liệu hiện có gồm đặc trưng X và nhãn y.
Bài tập này là một phần của khóa học
Phát hiện gian lận với Python
Hướng dẫn bài tập
- Import bộ phân loại random forest từ
sklearn. - Chia đặc trưng
Xvà nhãnythành tập huấn luyện và tập kiểm tra. Dành 30% cho tập kiểm tra. - Gán bộ phân loại random forest cho
modelvà giữrandom_state= 5. Cần đặt random state để có thể so sánh kết quả giữa các mô hình.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the random forest model from sklearn
from sklearn.ensemble import ____
# Split your data into training and test set
X_train, X_test, y_train, y_test = ____(____, ____, test_size=____, random_state=0)
# Define the model as the random forest
model = ____(random_state=5)