Знакомые и незнакомые данные
Как правило, модели показывают более высокую точность на тех наблюдениях, которые они уже видели при обучении. В наборе данных о конфетах предсказать популярность Skittles, скорее всего, будет проще, чем предсказать популярность Andes Mints: Skittles есть в наборе данных, а Andes Mints — нет.
Вы построили модель на основе 50 конфет, используя набор данных X_train. Теперь нужно оценить, насколько точно модель предсказывает популярность тех 50 конфет, на которых она обучалась, а также 35 конфет (X_test), которых она ещё не видела. В качестве метрики точности используйте среднюю абсолютную ошибку — функцию mae().
Это упражнение является частью курса
Валидация моделей на Python
Инструкции к упражнению
- Используя
X_trainиX_testв качестве входных данных, создайте массивы предсказаний с помощьюmodel.predict(). - Вычислите точность модели как на данных, которые она уже видела, так и на данных, которые для неё новые.
- Воспользуйтесь операторами вывода, чтобы напечатать результаты для знакомых и незнакомых данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))