Performance en échantillon
Il est très important de savoir si votre modèle de régression est utile ou non. Un modèle utile peut être celui qui saisit bien la structure de votre ensemble d'entraînement. Une façon d'évaluer cette performance « en échantillon » consiste à prédire sur les données d'entraînement et à calculer l'erreur absolue moyenne de tous les points de données prédits.
Dans cet exercice, vous allez évaluer vos prédictions en échantillon à l'aide de la MAE (mean absolute error). La MAE indique à quel point, en moyenne, les prédictions s'éloignent des valeurs réelles.
Elle se calcule avec la formule suivante, où \(n\) est le nombre de prédictions faites :
$$MAE = \frac{1}{n} \cdot \sum_{i=1}^n \text{valeur absolue de la }i\text{e erreur}$$
Votre espace de travail contient model, l'arbre de régression que vous avez construit dans les exercices précédents.
Cette activité fait partie du cours
Machine Learning avec des modèles arborescents en R
Instructions de l’exercice
- Créez
in_sample_predictionsen utilisantmodelpour prédire sur le tibblechocolate_train. - Calculez un vecteur
abs_diffsqui contient les différences absolues entre les prédictions en échantillon et les notes réelles. - Calculez la mean absolute error (MAE) selon la formule ci-dessus.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Predict using the training set
in_sample_predictions <- predict(model,
___)
# Calculate the vector of absolute differences
abs_diffs <- ___(__$___ - ___$___)
# Calculate the mean absolute error
1 / ___ * ___