Weryfikacja modelu nagród
Wracasz do dostrajania modelu i zauważasz, że jego wydajność nadal jest gorsza w porównaniu z modelem bazowym. Tym razem chcesz przyjrzeć się modelowi nagród – przygotowałeś zbiór danych z wynikami tego modelu i zamierzasz go przeanalizować. Jakie kontrole wykonasz na danych wyjściowych?
Zbiór danych został wstępnie zaimportowany jako reward_model_results.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie