Začněte nyníZačněte zdarma

Kontrola modelu odměn

Vracíš se k doladění modelu a zjišťuješ, že jeho výkon je stále horší než u základního modelu. Tentokrát chceš prověřit model odměn – připravil/a sis dataset s výsledky z tohoto modelu, který teď budeš analyzovat. Jaké kontroly na výstupních datech provedeš?

Dataset byl předem načten jako reward_model_results.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení