Trenowanie, dostrajanie i informacja zwrotna
Pracujesz nad projektem, w którym stosujesz technikę uczenia przez wzmacnianie z informacją zwrotną od człowieka (RLHF), aby zoptymalizować działanie modelu w środowisku obsługi klienta.
Która z poniższych opcji najdokładniej opisuje proces RLHF?
To ćwiczenie jest częścią kursu
Koncepcje dużych modeli językowych (LLM)
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie