Atenuarea divergenței KL negative
Ai antrenat modelul folosind tehnici RLHF și ai observat că performanța acestuia s-a deteriorat față de modelul de bază. Suspectezi că problema este cauzată de divergența KL negativă, așadar vrei să setezi parametrii de generare corecți pentru a preveni această situație.
tokenizer a fost importat în prealabil.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Setează
top_kșimin_lengthla valori care ajută la evitarea divergenței KL.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}