Statistici de validare încrucișată
Ai folosit grid search CV pentru a ajusta clasificatorul tău de tip random forest și acum vrei să inspectezi rezultatele validării încrucișate, pentru a te asigura că nu ai supraantrenat modelul. Mai exact, vrei să calculezi diferența dintre scorul mediu de testare pentru fiecare fold și scorul mediu de antrenament. Setul de date este disponibil ca X_train și y_train, pipeline-ul ca pipe, iar mai multe module sunt preîncărcate, inclusiv pandas ca pd și GridSearchCV().
Acest exercițiu face parte din cursul
Proiectarea fluxurilor de lucru pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Creează un obiect de tip grid search cu trei fold-uri de validare încrucișată și asigură-te că returnează atât statistici de antrenament, cât și de testare.
- Antrenează obiectul de tip grid search pe datele de antrenament.
- Stochează rezultatele validării încrucișate, disponibile în atributul
cv_results_al obiectului CV antrenat, într-un dataframe. - Afișează diferența dintre coloana care conține scorul mediu de testare și cea care conține scorul mediu de antrenament.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fit your pipeline using GridSearchCV with three folds
grid_search = GridSearchCV(
pipe, params, ____=3, return_train_score=____)
# Fit the grid search
gs = grid_search.____(____, ____)
# Store the results of CV into a pandas dataframe
results = pd.____(gs.____)
# Print the difference between mean test and training scores
print(
results[____]-results['mean_train_score'])