Baseline dựa trên gradient boosting
Hãy xây dựng một baseline cuối cùng dựa trên Random Forest. Bạn đã thấy điểm số cải thiện rõ rệt khi chuyển từ baseline gom nhóm sang Gradient Boosting trong video. Giờ bạn sẽ dùng Random Forest của sklearn để tiếp tục cải thiện điểm số.
Mục tiêu của bài tập này là lấy các đặc trưng số và huấn luyện một mô hình Random Forest không tinh chỉnh siêu tham số. Sau đó, bạn có thể tạo dự đoán cho tập kiểm tra và xác thực kết quả trên Public Leaderboard. Lưu ý rằng bạn đã có đặc trưng "hour", đặc trưng này cũng có thể dùng làm đầu vào cho mô hình.
Bài tập này là một phần của khóa học
Chinh phục cuộc thi Kaggle bằng Python
Hướng dẫn bài tập
- Thêm đặc trưng
"hour"vào danh sách các đặc trưng số. - Huấn luyện
RandomForestRegressortrên dữ liệu train với các đặc trưng số và"fare_amount"là mục tiêu. - Dùng mô hình Random Forest đã huấn luyện để tạo dự đoán trên dữ liệu test.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)