Validare încrucișată
În următoarele câteva exerciții vei regla modelul tău de regresie logistică folosind o procedură numită validare încrucișată k-fold. Aceasta este o metodă de estimare a performanței modelului pe date nevăzute (cum ar fi DataFrame-ul tău test).
Metoda funcționează prin împărțirea datelor de antrenare în câteva partiții diferite. Numărul exact îl alegi tu, însă în acest curs vei folosi valoarea implicită din PySpark, adică trei. Odată ce datele sunt împărțite, una dintre partiții este rezervată, iar modelul este antrenat pe celelalte. Apoi eroarea este măsurată față de partiția rezervată. Acest proces se repetă pentru fiecare partiție, astfel încât fiecare bloc de date este rezervat și folosit ca set de testare exact o dată. În final, erorile de pe fiecare partiție sunt calculate ca medie. Aceasta se numește eroarea de validare încrucișată a modelului și reprezintă o bună estimare a erorii reale pe datele rezervate.
Vei folosi validarea încrucișată pentru a alege hiperparametrii, creând o grilă cu toate perechile posibile de valori pentru cei doi hiperparametri, elasticNetParam și regParam, și folosind eroarea de validare încrucișată pentru a compara toate modelele diferite și a-l alege pe cel mai bun!
Ce îți permite să estimezi validarea încrucișată?
Acest exercițiu face parte din cursul
Fundamente PySpark
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul