Träning, finjustering och feedback
Du arbetar med ett projekt där du ska utveckla en modell med tekniken Reinforcement Learning through Human Feedback (RLHF) för att optimera dess prestanda i en kundtjänstmiljö.
Vilket av dessa alternativ beskriver RLHF-processen mest korrekt?
Den här övningen är en del av kursen
Koncept inom stora språkmodeller (LLM)
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen