ÎncepețiÎncepe gratuit

Statistici de validare încrucișată

Ai folosit grid search CV pentru a ajusta clasificatorul tău de tip random forest și acum vrei să inspectezi rezultatele validării încrucișate, pentru a te asigura că nu ai supraantrenat modelul. Mai exact, vrei să calculezi diferența dintre scorul mediu de testare pentru fiecare fold și scorul mediu de antrenament. Setul de date este disponibil ca X_train și y_train, pipeline-ul ca pipe, iar mai multe module sunt preîncărcate, inclusiv pandas ca pd și GridSearchCV().

Acest exercițiu face parte din cursul

Proiectarea fluxurilor de lucru pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un obiect de tip grid search cu trei fold-uri de validare încrucișată și asigură-te că returnează atât statistici de antrenament, cât și de testare.
  • Antrenează obiectul de tip grid search pe datele de antrenament.
  • Stochează rezultatele validării încrucișate, disponibile în atributul cv_results_ al obiectului CV antrenat, într-un dataframe.
  • Afișează diferența dintre coloana care conține scorul mediu de testare și cea care conține scorul mediu de antrenament.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Fit your pipeline using GridSearchCV with three folds
grid_search = GridSearchCV(
  pipe, params, ____=3, return_train_score=____)

# Fit the grid search
gs = grid_search.____(____, ____)

# Store the results of CV into a pandas dataframe
results = pd.____(gs.____)

# Print the difference between mean test and training scores
print(
  results[____]-results['mean_train_score'])
Editează și rulează codul