Ajuster un arbre de décision
Les forêts aléatoires sont souvent le modèle de référence pour les prédictions ; elles fonctionnent très bien sans réglages fins. Mais commençons par le bloc de base des random forests : les arbres de décision.
Les arbres de décision découpent les données en groupes à partir des variables explicatives. Ils commencent par un nœud racine, puis segmentent les données jusqu'à atteindre des feuilles.

Nous pouvons utiliser sklearn pour ajuster un arbre de décision avec DecisionTreeRegressor et .fit(features, targets).
Si l'on ne limite pas la profondeur (ou hauteur) de l'arbre, il continuera à scinder les données jusqu'à ce que chaque feuille ne contienne plus qu'un seul échantillon, ce qui est l'exemple parfait de surapprentissage. Nous en parlerons davantage dans les prochains chapitres.
Cet exercice fait partie du cours
<cours>Machine Learning pour la finance en Python</cours>Instructions de l’exercice
- Utilisez la classe importée
DecisionTreeRegressoravec ses arguments par défaut (c'est-à-dire sans argument) pour créer un modèle d'arbre de décision appelédecision_tree. - Ajustez le modèle en utilisant
train_featuresettrain_targetsque nous avons créés plus tôt (ils contiennent désormais les variables du jour de la semaine et du volume). - Affichez le score sur les variables et cibles d'entraînement, ainsi que sur
test_featuresettest_targets.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from sklearn.tree import DecisionTreeRegressor
# Create a decision tree regression model with default arguments
decision_tree = ____
# Fit the model to the training features and targets
decision_tree.fit(____)
# Check the score on train and test
print(decision_tree.score(train_features, train_targets))
print(decision_tree.score(____))