Statistiques de validation croisée
Vous avez utilisé une recherche sur grille avec validation croisée pour optimiser votre classifieur random forest et vous voulez maintenant examiner les résultats de validation croisée afin de vérifier que vous n'avez pas surappris. En particulier, vous souhaitez soustraire, pour chaque pli, la moyenne des scores de test de la moyenne des scores d'entraînement. L'ensemble de données est disponible sous X_train et y_train, le pipeline sous pipe, et plusieurs modules sont préchargés, dont pandas sous pd et GridSearchCV().
Cette activité fait partie du cours
Concevoir des flux de travail Machine Learning en Python
Instructions de l’exercice
- Créez un objet de recherche sur grille avec trois plis de validation croisée et assurez-vous qu'il retourne aussi bien les statistiques d'entraînement que de test.
- Entraînez l'objet de recherche sur grille sur les données d'entraînement.
- Placez les résultats de la validation croisée, accessibles dans l'attribut
cv_results_de l'objet CV entraîné, dans un tableau de données. - Affichez la différence entre la colonne qui contient la moyenne des scores de test et celle qui contient la moyenne des scores d'entraînement.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Fit your pipeline using GridSearchCV with three folds
grid_search = GridSearchCV(
pipe, params, ____=3, return_train_score=____)
# Fit the grid search
gs = grid_search.____(____, ____)
# Store the results of CV into a pandas dataframe
results = pd.____(gs.____)
# Print the difference between mean test and training scores
print(
results[____]-results['mean_train_score'])