Sử dụng chỉ số KFold
Bạn đã tạo sẵn splits, chứa các chỉ số cho bộ dữ liệu candy-data để thực hiện cross-validation 5-fold. Để ước lượng tốt hơn việc mô hình random forest của đồng nghiệp sẽ hoạt động thế nào trên dữ liệu mới, bạn muốn chạy mô hình này trên năm cặp chỉ số huấn luyện và kiểm định vừa tạo.
Trong bài tập này, bạn sẽ dùng các chỉ số đó để kiểm tra độ chính xác của mô hình qua năm lần chia. Một vòng lặp for đã được cung cấp để hỗ trợ quá trình này.
Bài tập này là một phần của khóa học
Xác thực Mô hình trong Python
Hướng dẫn bài tập
- Dùng
train_indexvàval_indexđể lấy đúng chỉ số củaXvàykhi tạo dữ liệu huấn luyện và kiểm định. - Fit
rfcbằng tập dữ liệu huấn luyện - Dùng
rfcđể tạo dự đoán cho tập kiểm định và in ra độ chính xác trên kiểm định
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error
rfc = RandomForestRegressor(n_estimators=25, random_state=1111)
# Access the training and validation indices of splits
for train_index, val_index in splits:
# Setup the training and validation data
X_train, y_train = X[____], y[____]
X_val, y_val = X[____], y[____]
# Fit the random forest model
rfc.____(____, ____)
# Make predictions, and print the accuracy
predictions = rfc.____(____)
print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))