Entraînement avec bootstrap
Construisons maintenant un « faible » classificateur par arbre de décision et entraînons-le sur un échantillon de l'ensemble d'entraînement tiré avec remise. Cela vous aidera à comprendre ce qui se passe à chaque itération d'un ensemble de bagging.
Pour prélever un échantillon, vous utiliserez la méthode .sample() de pandas, qui propose le paramètre replace. Par exemple, la ligne de code suivante effectue un tirage avec remise à partir de tout le DataFrame df :
df.sample(frac=1.0, replace=True, random_state=42)
Cette activité fait partie du cours
Méthodes d'ensemble en Python
Instructions de l’exercice
- Prélevez un échantillon avec remise (
replace=True) sur l'ensemble complet (frac=1.0) d'entraînement,X_train. - Créez un classificateur par arbre de décision avec le paramètre
max_depth = 4. - Ajustez le modèle sur les données d'entraînement échantillonnées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Take a sample with replacement
X_train_sample = X_train.____(____, ____, random_state=42)
y_train_sample = y_train.loc[X_train_sample.index]
# Build a "weak" Decision Tree classifier
clf = ____(____, random_state=500)
# Fit the model to the training sample
____