Đánh giá hiệu năng
Cuối cùng, như mọi khi, bạn cần đánh giá hiệu năng của mô hình tốt nhất để xem chúng ta làm tốt hay chưa. Lý tưởng nhất là làm back-testing, nhưng đó là một quy trình phức tạp nằm ngoài phạm vi khóa học này.
Chúng ta đã xem điểm R\(^2\), nhưng hãy cùng xem biểu đồ phân tán của giá trị dự đoán so với giá trị thực tế bằng matplotlib. Dự đoán hoàn hảo sẽ tạo thành một đường chéo từ góc dưới bên trái lên góc trên bên phải.
Bài tập này là một phần của khóa học
Machine Learning cho Tài chính bằng Python
Hướng dẫn bài tập
- Dùng số tốt nhất cho
max_featurestrongRandomForestRegressor(rfr) mà chúng ta đã tìm được ở bài trước (là 4). - Tạo dự đoán bằng mô hình với
train_featuresvàtest_features. - Vẽ scatter mục tiêu thực tế (train/test_targets) so với dự đoán (train/test_predictions), và gắn nhãn các tập dữ liệu là
trainvàtest.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Use the best hyperparameters from before to fit a random forest model
rfr = RandomForestRegressor(n_estimators=200, max_depth=3, max_features=____, random_state=42)
rfr.fit(train_features, train_targets)
# Make predictions with our model
train_predictions = rfr.predict(____)
test_predictions = ____
# Create a scatter plot with train and test actual vs predictions
plt.scatter(train_targets, train_predictions, label='train')
plt.scatter(____)
plt.legend()
plt.show()