CommencezCommencez gratuitement

Données vues vs non vues

Les modèles ont tendance à être plus précis sur les observations qu'ils ont déjà vues. Dans l'ensemble de données sur les friandises, prédire la popularité des Skittles sera probablement plus précis que prédire celle des Andes Mints; Skittles figure dans l'ensemble de données, alors que Andes Mints n'y figure pas.

Vous avez entraîné un modèle à partir de 50 friandises en utilisant l'ensemble X_train et vous devez indiquer à quel point le modèle est précis pour prédire la popularité des 50 friandises sur lesquelles il a été entraîné, ainsi que celle des 35 friandises (X_test) qu'il n'a jamais vues. Vous utiliserez l'erreur absolue moyenne, mae(), comme mesure de précision.

Cette activité fait partie du cours

Validation de modèles en Python

Voir le cours

Instructions de l’exercice

  • En utilisant X_train et X_test comme données d'entrée, créez des tableaux de prédictions avec model.predict().
  • Calculez la précision du modèle à la fois sur des données qu'il a vues et sur des données qu'il n'a jamais vues.
  • Utilisez les instructions d'impression pour afficher les données vues et non vues.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# The model is fit using X_train and y_train
model.fit(X_train, y_train)

# Create vectors of predictions
train_predictions = model.predict(____)
test_predictions = model.predict(____)

# Train/Test Errors
train_error = mae(y_true=y_train, y_pred=____)
test_error = mae(y_true=y_test, y_pred=____)

# Print the accuracy for seen and unseen data
print("Model error on seen data: {0:.2f}.".format(____))
print("Model error on unseen data: {0:.2f}.".format(____))
Modifier et exécuter le code