Kom igångKom igång gratis

Träning, finjustering och feedback

Du arbetar med ett projekt där du ska utveckla en modell med tekniken Reinforcement Learning through Human Feedback (RLHF) för att optimera dess prestanda i en kundtjänstmiljö.

Vilket av dessa alternativ beskriver RLHF-processen mest korrekt?

Den här övningen är en del av kursen

Koncept inom stora språkmodeller (LLM)

Visa kurs

Interaktiv övning med praktiskt arbete

Gör teori till handling med en av våra interaktiva övningar

Starta övningen