Побачені vs. непобачені дані
Моделі зазвичай мають вищу точність на прикладах, які вони вже бачили. У наборі даних про цукерки передбачення популярності Skittles, імовірно, буде точнішим, ніж передбачення популярності Andes Mints; Skittles є в наборі даних, а Andes Mints — ні.
Ви побудували модель на основі 50 видів цукерок, використовуючи набір X_train, і маєте відзвітувати, наскільки точно модель передбачає популярність тих самих 50 цукерок, на яких вона навчалася, а також 35 цукерок (X_test), яких вона ніколи не бачила. Ви використаєте середню абсолютну помилку, mae(), як метрику точності.
Ця вправа є частиною курсу
Валідація моделей у Python
Інструкції до вправи
- Використовуючи
X_trainіX_testяк вхідні дані, створіть масиви передбачень за допомогоюmodel.predict(). - Обчисліть точність моделі як на даних, які модель бачила, так і на даних, яких вона не бачила раніше.
- Скористайтеся операторами друку, щоб вивести результати для побачених і непобачених даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))