Verificarea modelului de recompensă
Te întorci la procesul de fine-tuning și observi că performanța modelului este în continuare mai slabă față de modelul de bază. De data aceasta, vrei să inspectezi modelul de recompensă și ai generat un set de date cu rezultate produse de acesta, pe care urmează să le analizezi. Ce verificări vei efectua asupra datelor de ieșire?
Setul de date a fost pre-importat ca reward_model_results.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul