Performances en échantillon et hors échantillon
Un modèle plus sophistiqué donne-t-il toujours de meilleurs résultats? Comme nous l'avons vu dans la vidéo, ce n'est qu'à moitié vrai.
Les modèles surajustés saisissent parfaitement la structure de leur ensemble d'entraînement, mais n'arrivent pas à généraliser à de nouvelles données. Pas très utile! Au bout du compte, l'objectif principal d'un modèle prédictif est de bien performer sur de nouvelles données, n'est-ce pas? Allez vérifier!
Sont déjà chargés en mémoire le dernier modèle de l'exercice précédent, complex_model, ainsi que vos données d'entraînement et de test (chocolate_train et chocolate_test).
Cette activité fait partie du cours
Machine Learning avec des modèles arborescents en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Predict on and combine with training data and calculate the error
predict(___, new_data = ___) %>%
___ %>%
mae(___,
___)