Antrenament, ajustare și feedback
Lucrezi la un proiect de dezvoltare a unui model folosind tehnica Reinforcement Learning through Human Feedback (RLHF), cu scopul de a-i optimiza performanța într-un mediu de suport pentru clienți.
Care dintre opțiunile de mai jos descrie cel mai precis procesul RLHF?
Acest exercițiu face parte din cursul
Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul