ÎncepețiÎncepe gratuit

Creează două seturi de validare holdout

Ai creat recent un model simplu de pădure aleatoare (random forest) pentru a prezice victoriile în jocul X și O pentru managerul tău și, la cererea ei, nu ai efectuat nicio ajustare a parametrilor. Din păcate, acuratețea generală a modelului a fost prea scăzută față de standardele ei. De data aceasta, ea ți-a cerut să te concentrezi pe performanța modelului.

Înainte de a începe să testezi diferite modele și seturi de parametri, va trebui să împarți datele în seturi de antrenament, validare și testare. Reține că, după împărțirea datelor în seturi de antrenament și testare, setul de validare se obține prin divizarea setului de antrenament.

Seturile de date X și y au fost încărcate și sunt disponibile pentru utilizare.

Acest exercițiu face parte din cursul

Validarea modelelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează seturi de date temporare și seturi de date de testare (X_test, y_test). Folosește 20% din totalul datelor pentru seturile de testare.
  • Folosind seturile de date temporare (X_temp, y_temp), creează seturi de antrenament (X_train, y_train) și de validare (X_val, y_val).
  • Folosește 25% din datele temporare pentru seturile de validare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create temporary training and final testing datasets
X_temp, ____, y_temp, ____  =\
    train_test_split(X, y, ____=____, random_state=1111)

# Create the final training and validation datasets
____, ____, ____, ____ =\
    train_test_split(X_temp, y_temp, ____=____, random_state=1111)
Editează și rulează codul