Huấn luyện một cây quyết định
Random forests là mô hình mặc định rất hiệu quả cho bài toán dự đoán; chúng hoạt động tốt ngay cả khi không tinh chỉnh. Nhưng trước hết, bạn sẽ học khối xây dựng nên random forests — cây quyết định.
Cây quyết định chia dữ liệu thành các nhóm dựa trên các đặc trưng. Cây bắt đầu từ nút gốc (root) và tiếp tục tách dữ liệu cho đến khi đạt đến các nút lá (leaf).

Bạn có thể dùng sklearn để huấn luyện một cây quyết định với DecisionTreeRegressor và .fit(features, targets).
Nếu không giới hạn độ sâu (hoặc chiều cao) của cây, mô hình sẽ tiếp tục tách cho đến khi mỗi lá chỉ còn 1 mẫu, đây chính là cực hạn của overfitting. Bạn sẽ học thêm về overfitting ở các chương sau.
Bài tập này là một phần của khóa học
Machine Learning cho Tài chính bằng Python
Hướng dẫn bài tập
- Dùng class đã nhập
DecisionTreeRegressorvới các tham số mặc định (tức là không truyền tham số) để tạo mô hình cây quyết định têndecision_tree. - Huấn luyện mô hình với
train_featuresvàtrain_targetsmà bạn đã tạo trước đó (hiện có các đặc trưng thứ trong tuần và khối lượng giao dịch). - In điểm số trên tập huấn luyện (features và targets) cũng như trên
test_featuresvàtest_targets.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from sklearn.tree import DecisionTreeRegressor
# Create a decision tree regression model with default arguments
decision_tree = ____
# Fit the model to the training features and targets
decision_tree.fit(____)
# Check the score on train and test
print(decision_tree.score(train_features, train_targets))
print(decision_tree.score(____))