Ajuster les hyperparamètres du bagging
Même si vous pouvez facilement construire un classifieur de bagging avec les paramètres par défaut, il est fortement recommandé de les ajuster pour obtenir une performance optimale. Idéalement, cet ajustement devrait se faire au moyen d'une validation croisée K-fold.
Dans cet exercice, voyons si nous pouvons améliorer la performance du modèle en modifiant les paramètres du classifieur de bagging.
Ici, nous passons aussi le paramètre solver='liblinear' à LogisticRegression pour réduire le temps de calcul.
Cette activité fait partie du cours
Méthodes d'ensemble en Python
Instructions de l’exercice
- Construisez un classifieur de bagging en utilisant comme base la régression logistique, avec
20estimateurs de base,10caractéristiques maximales,0.65(65 %) d'échantillons maximaux (max_samples), et un échantillonnage sans remplacement. - Utilisez
clf_bagpour prédire les étiquettes de l'ensemble de test,X_test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build a balanced logistic regression
clf_base = LogisticRegression(class_weight='balanced', solver='liblinear', random_state=42)
# Build and fit a bagging classifier with custom parameters
clf_bag = ____(____, ____, ____, ____, ____, random_state=500)
clf_bag.fit(X_train, y_train)
# Calculate predictions and evaluate the accuracy on the test set
y_pred = ____
print('Accuracy: {:.2f}'.format(accuracy_score(y_test, y_pred)))
# Print the classification report
print(classification_report(y_test, y_pred))