CommencezCommencez gratuitement

Performance en échantillon

Il est très important de savoir si votre modèle de régression est utile ou non. Un modèle utile peut être celui qui saisit bien la structure de votre ensemble d'entraînement. Une façon d'évaluer cette performance « en échantillon » consiste à prédire sur les données d'entraînement et à calculer l'erreur absolue moyenne de tous les points de données prédits.

Dans cet exercice, vous allez évaluer vos prédictions en échantillon à l'aide de la MAE (mean absolute error). La MAE indique à quel point, en moyenne, les prédictions s'éloignent des valeurs réelles.

Elle se calcule avec la formule suivante, où \(n\) est le nombre de prédictions faites :

$$MAE = \frac{1}{n} \cdot \sum_{i=1}^n \text{valeur absolue de la }i\text{e erreur}$$

Votre espace de travail contient model, l'arbre de régression que vous avez construit dans les exercices précédents.

Cette activité fait partie du cours

Machine Learning avec des modèles arborescents en R

Voir le cours

Instructions de l’exercice

  • Créez in_sample_predictions en utilisant model pour prédire sur le tibble chocolate_train.
  • Calculez un vecteur abs_diffs qui contient les différences absolues entre les prédictions en échantillon et les notes réelles.
  • Calculez la mean absolute error (MAE) selon la formule ci-dessus.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Predict using the training set
in_sample_predictions <- predict(model,
                                 ___)

# Calculate the vector of absolute differences
abs_diffs <- ___(__$___ - ___$___)

# Calculate the mean absolute error
1 / ___ * ___
Modifier et exécuter le code