开始使用免费开始使用

已见数据 vs. 未见数据

模型在见过的观测上通常会有更高的准确率。在糖果数据集中,预测 Skittles 的受欢迎程度往往会比预测 Andes Mints 更准确;因为 Skittles 在数据集中,而 Andes Mints 不在。

您已经基于 50 种糖果,用数据集 X_train 训练了一个模型。现在需要报告该模型在两类数据上的预测准确性:一是用于构建模型的这 50 种糖果,二是模型从未见过的 35 种糖果(X_test)。您将使用平均绝对误差 mae() 作为准确性度量。

本练习是课程的一部分

Python 中的模型验证

查看课程

练习说明

  • 使用 X_trainX_test 作为输入数据,调用 model.predict() 创建预测结果数组。
  • 分别计算模型在见过的数据和未见过的数据上的准确性。
  • 使用提供的打印语句输出已见数据与未见数据的结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# The model is fit using X_train and y_train
model.fit(X_train, y_train)

# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)

# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)

# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))
编辑并运行代码