CommencezCommencez gratuitement

Erreur due au sous/apprentissage excessif

Le jeu de données sur les bonbons se prête facilement à l'apprentissage excessif (overfitting). Avec seulement 85 observations, si vous réservez 20 % pour l'ensemble de test, vous perdez beaucoup de données essentielles qui pourraient servir à l'entraînement du modèle. Imaginez que la plupart des bonbons au chocolat se retrouvent dans les données d'entraînement et très peu dans l'échantillon de validation. Notre modèle pourrait ne voir que le chocolat comme facteur déterminant et ne pas détecter que d'autres attributs comptent aussi. Dans cet exercice, vous allez explorer comment l'utilisation d'un trop grand nombre de caractéristiques (colonnes) dans un modèle de forêt aléatoire peut mener à l'apprentissage excessif.

Une caractéristique indique quelles colonnes des données sont utilisées dans un arbre de décision. Le paramètre max_features limite le nombre de caractéristiques disponibles.

Cette activité fait partie du cours

Validation de modèles en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
Modifier et exécuter le code