Motverka negativ KL-divergens
Du har finjusterat modellen med RLHF-tekniker och märkt att modellens prestanda har försämrats jämfört med basmodellen. Du misstänker att detta beror på negativ KL-divergens och vill därför ställa in rätt genereringsparametrar för att förhindra problemet.
tokenizer har importerats i förväg.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Sätt
top_kochmin_lengthtill värden som hjälper till att undvika KL-divergens.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}