CommencerCommencez gratuitement

Ajuster un arbre de décision

Les forêts aléatoires sont souvent le modèle de référence pour les prédictions ; elles fonctionnent très bien sans réglages fins. Mais commençons par le bloc de base des random forests : les arbres de décision.

Les arbres de décision découpent les données en groupes à partir des variables explicatives. Ils commencent par un nœud racine, puis segmentent les données jusqu'à atteindre des feuilles.

decision tree

Nous pouvons utiliser sklearn pour ajuster un arbre de décision avec DecisionTreeRegressor et .fit(features, targets).

Si l'on ne limite pas la profondeur (ou hauteur) de l'arbre, il continuera à scinder les données jusqu'à ce que chaque feuille ne contienne plus qu'un seul échantillon, ce qui est l'exemple parfait de surapprentissage. Nous en parlerons davantage dans les prochains chapitres.

Cet exercice fait partie du cours

<cours>Machine Learning pour la finance en Python</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez la classe importée DecisionTreeRegressor avec ses arguments par défaut (c'est-à-dire sans argument) pour créer un modèle d'arbre de décision appelé decision_tree.
  • Ajustez le modèle en utilisant train_features et train_targets que nous avons créés plus tôt (ils contiennent désormais les variables du jour de la semaine et du volume).
  • Affichez le score sur les variables et cibles d'entraînement, ainsi que sur test_features et test_targets.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from sklearn.tree import DecisionTreeRegressor

# Create a decision tree regression model with default arguments
decision_tree = ____

# Fit the model to the training features and targets
decision_tree.fit(____)

# Check the score on train and test
print(decision_tree.score(train_features, train_targets))
print(decision_tree.score(____))
Modifier et exécuter le code