ÎncepețiÎncepe gratuit

Antrenament, ajustare și feedback

Lucrezi la un proiect de dezvoltare a unui model folosind tehnica Reinforcement Learning through Human Feedback (RLHF), cu scopul de a-i optimiza performanța într-un mediu de suport pentru clienți.

Care dintre opțiunile de mai jos descrie cel mai precis procesul RLHF?

Acest exercițiu face parte din cursul

Concepte privind Modelele de Limbaj de Mari Dimensiuni (LLM)

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul