Bắt đầu ngayBắt đầu miễn phí

Sử dụng chỉ số KFold

Bạn đã tạo sẵn splits, chứa các chỉ số cho bộ dữ liệu candy-data để thực hiện cross-validation 5-fold. Để ước lượng tốt hơn việc mô hình random forest của đồng nghiệp sẽ hoạt động thế nào trên dữ liệu mới, bạn muốn chạy mô hình này trên năm cặp chỉ số huấn luyện và kiểm định vừa tạo.

Trong bài tập này, bạn sẽ dùng các chỉ số đó để kiểm tra độ chính xác của mô hình qua năm lần chia. Một vòng lặp for đã được cung cấp để hỗ trợ quá trình này.

Bài tập này là một phần của khóa học

Xác thực Mô hình trong Python

Xem khóa học

Hướng dẫn bài tập

  • Dùng train_indexval_index để lấy đúng chỉ số của Xy khi tạo dữ liệu huấn luyện và kiểm định.
  • Fit rfc bằng tập dữ liệu huấn luyện
  • Dùng rfc để tạo dự đoán cho tập kiểm định và in ra độ chính xác trên kiểm định

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error

rfc = RandomForestRegressor(n_estimators=25, random_state=1111)

# Access the training and validation indices of splits
for train_index, val_index in splits:
    # Setup the training and validation data
    X_train, y_train = X[____], y[____]
    X_val, y_val = X[____], y[____]
    # Fit the random forest model
    rfc.____(____, ____)
    # Make predictions, and print the accuracy
    predictions = rfc.____(____)
    print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))
Chỉnh sửa và Chạy Mã