Zacznij terazZacznij za darmo

Weryfikacja modelu nagród

Wracasz do dostrajania modelu i zauważasz, że jego wydajność nadal jest gorsza w porównaniu z modelem bazowym. Tym razem chcesz przyjrzeć się modelowi nagród – przygotowałeś zbiór danych z wynikami tego modelu i zamierzasz go przeanalizować. Jakie kontrole wykonasz na danych wyjściowych?

Zbiór danych został wstępnie zaimportowany jako reward_model_results.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie