Kom igångKom igång gratis

Motverka negativ KL-divergens

Du har finjusterat modellen med RLHF-tekniker och märkt att modellens prestanda har försämrats jämfört med basmodellen. Du misstänker att detta beror på negativ KL-divergens och vill därför ställa in rätt genereringsparametrar för att förhindra problemet.

tokenizer har importerats i förväg.

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Sätt top_k och min_length till värden som hjälper till att undvika KL-divergens.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Redigera och kör kod