CommencezCommencez gratuitement

Entraînement avec bootstrap

Construisons maintenant un « faible » classificateur par arbre de décision et entraînons-le sur un échantillon de l'ensemble d'entraînement tiré avec remise. Cela vous aidera à comprendre ce qui se passe à chaque itération d'un ensemble de bagging.

Pour prélever un échantillon, vous utiliserez la méthode .sample() de pandas, qui propose le paramètre replace. Par exemple, la ligne de code suivante effectue un tirage avec remise à partir de tout le DataFrame df :

df.sample(frac=1.0, replace=True, random_state=42)

Cette activité fait partie du cours

Méthodes d'ensemble en Python

Voir le cours

Instructions de l’exercice

  • Prélevez un échantillon avec remise (replace=True) sur l'ensemble complet (frac=1.0) d'entraînement, X_train.
  • Créez un classificateur par arbre de décision avec le paramètre max_depth = 4.
  • Ajustez le modèle sur les données d'entraînement échantillonnées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Take a sample with replacement
X_train_sample = X_train.____(____, ____, random_state=42)
y_train_sample = y_train.loc[X_train_sample.index]

# Build a "weak" Decision Tree classifier
clf = ____(____, random_state=500)

# Fit the model to the training sample
____
Modifier et exécuter le code