Dữ liệu đã thấy vs. chưa thấy
Mô hình thường có độ chính xác cao hơn trên các quan sát mà nó đã từng thấy. Trong bộ dữ liệu kẹo, dự đoán mức độ phổ biến của Skittles có khả năng chính xác hơn so với Andes Mints; Skittles có trong tập dữ liệu, còn Andes Mints thì không.
Bạn đã xây dựng một mô hình dựa trên 50 loại kẹo sử dụng tập X_train và cần báo cáo độ chính xác của mô hình khi dự đoán mức độ phổ biến của 50 loại kẹo đã dùng để xây dựng mô hình, cũng như 35 loại kẹo (X_test) mà mô hình chưa từng thấy. Bạn sẽ dùng mean absolute error, mae(), làm thước đo độ chính xác.
Bài tập này là một phần của khóa học
Xác thực Mô hình trong Python
Hướng dẫn bài tập
- Dùng
X_trainvàX_testlàm dữ liệu đầu vào, tạo các mảng dự đoán bằngmodel.predict(). - Tính độ chính xác của mô hình trên cả dữ liệu mô hình đã thấy và dữ liệu mô hình chưa từng thấy trước đó.
- Dùng các câu lệnh print để in kết quả cho dữ liệu đã thấy và chưa thấy.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))