Bắt đầu ngayBắt đầu miễn phí

Huấn luyện một cây quyết định

Random forests là mô hình mặc định rất hiệu quả cho bài toán dự đoán; chúng hoạt động tốt ngay cả khi không tinh chỉnh. Nhưng trước hết, bạn sẽ học khối xây dựng nên random forests — cây quyết định.

Cây quyết định chia dữ liệu thành các nhóm dựa trên các đặc trưng. Cây bắt đầu từ nút gốc (root) và tiếp tục tách dữ liệu cho đến khi đạt đến các nút lá (leaf).

decision tree

Bạn có thể dùng sklearn để huấn luyện một cây quyết định với DecisionTreeRegressor.fit(features, targets).

Nếu không giới hạn độ sâu (hoặc chiều cao) của cây, mô hình sẽ tiếp tục tách cho đến khi mỗi lá chỉ còn 1 mẫu, đây chính là cực hạn của overfitting. Bạn sẽ học thêm về overfitting ở các chương sau.

Bài tập này là một phần của khóa học

Machine Learning cho Tài chính bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Dùng class đã nhập DecisionTreeRegressor với các tham số mặc định (tức là không truyền tham số) để tạo mô hình cây quyết định tên decision_tree.
  • Huấn luyện mô hình với train_featurestrain_targets mà bạn đã tạo trước đó (hiện có các đặc trưng thứ trong tuần và khối lượng giao dịch).
  • In điểm số trên tập huấn luyện (features và targets) cũng như trên test_featurestest_targets.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from sklearn.tree import DecisionTreeRegressor

# Create a decision tree regression model with default arguments
decision_tree = ____

# Fit the model to the training features and targets
decision_tree.fit(____)

# Check the score on train and test
print(decision_tree.score(train_features, train_targets))
print(decision_tree.score(____))
Chỉnh sửa và Chạy Mã