Bắt đầu ngayBắt đầu miễn phí

Lỗi do underfitting/overfitting

Bộ dữ liệu kẹo rất dễ bị overfitting. Chỉ có 85 quan sát, nếu bạn dùng 20% cho tập kiểm tra, bạn sẽ mất khá nhiều dữ liệu quan trọng có thể dùng để xây dựng mô hình. Hãy tưởng tượng tình huống hầu hết kẹo sô-cô-la rơi vào tập huấn luyện và chỉ rất ít nằm trong mẫu giữ lại. Mô hình của bạn có thể chỉ thấy rằng sô-cô-la là yếu tố then chốt, nhưng lại bỏ lỡ rằng các thuộc tính khác cũng quan trọng. Trong bài tập này, bạn sẽ khám phá cách việc dùng quá nhiều đặc trưng (cột) trong mô hình random forest có thể dẫn đến overfitting.

Một feature (đặc trưng) cho biết những cột nào của dữ liệu được dùng trong cây quyết định. Tham số max_features giới hạn số lượng đặc trưng có thể sử dụng.

Bài tập này là một phần của khóa học

Xác thực Mô hình trong Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
Chỉnh sửa và Chạy Mã