ÎncepețiÎncepe gratuit

Atenuarea divergenței KL negative

Ai antrenat modelul folosind tehnici RLHF și ai observat că performanța acestuia s-a deteriorat față de modelul de bază. Suspectezi că problema este cauzată de divergența KL negativă, așadar vrei să setezi parametrii de generare corecți pentru a preveni această situație.

tokenizer a fost importat în prealabil.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Setează top_k și min_length la valori care ajută la evitarea divergenței KL.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Editează și rulează codul