Kontrola modelu odměn
Vracíš se k doladění modelu a zjišťuješ, že jeho výkon je stále horší než u základního modelu. Tentokrát chceš prověřit model odměn – připravil/a sis dataset s výsledky z tohoto modelu, který teď budeš analyzovat. Jaké kontroly na výstupních datech provedeš?
Dataset byl předem načten jako reward_model_results.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení