Données vues vs non vues
Les modèles ont tendance à être plus précis sur les observations qu'ils ont déjà vues. Dans l'ensemble de données sur les friandises, prédire la popularité des Skittles sera probablement plus précis que prédire celle des Andes Mints; Skittles figure dans l'ensemble de données, alors que Andes Mints n'y figure pas.
Vous avez entraîné un modèle à partir de 50 friandises en utilisant l'ensemble X_train et vous devez indiquer à quel point le modèle est précis pour prédire la popularité des 50 friandises sur lesquelles il a été entraîné, ainsi que celle des 35 friandises (X_test) qu'il n'a jamais vues. Vous utiliserez l'erreur absolue moyenne, mae(), comme mesure de précision.
Cette activité fait partie du cours
Validation de modèles en Python
Instructions de l’exercice
- En utilisant
X_trainetX_testcomme données d'entrée, créez des tableaux de prédictions avecmodel.predict(). - Calculez la précision du modèle à la fois sur des données qu'il a vues et sur des données qu'il n'a jamais vues.
- Utilisez les instructions d'impression pour afficher les données vues et non vues.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# The model is fit using X_train and y_train
model.fit(X_train, y_train)
# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)
# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)
# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))