已见数据 vs. 未见数据
模型在见过的观测上通常会有更高的准确率。在糖果数据集中,预测 Skittles 的受欢迎程度往往会比预测 Andes Mints 更准确;因为 Skittles 在数据集中,而 Andes Mints 不在。
您已经基于 50 种糖果,用数据集 X_train 训练了一个模型。现在需要报告该模型在两类数据上的预测准确性:一是用于构建模型的这 50 种糖果,二是模型从未见过的 35 种糖果(X_test)。您将使用平均绝对误差 mae() 作为准确性度量。
本练习是课程的一部分
Python 中的模型验证
练习说明
- 使用
X_train和X_test作为输入数据,调用model.predict()创建预测结果数组。 - 分别计算模型在见过的数据和未见过的数据上的准确性。
- 使用提供的打印语句输出已见数据与未见数据的结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))