ÎncepețiÎncepe gratuit

Verificarea modelului de recompensă

Te întorci la procesul de fine-tuning și observi că performanța modelului este în continuare mai slabă față de modelul de bază. De data aceasta, vrei să inspectezi modelul de recompensă și ai generat un set de date cu rezultate produse de acesta, pe care urmează să le analizezi. Ce verificări vei efectua asupra datelor de ieșire?

Setul de date a fost pre-importat ca reward_model_results.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul