降低負向 KL 散度的影響
你正在使用 RLHF 技術微調模型,但發現模型的表現比基礎模型更差。你懷疑原因是負向 KL 散度,因此想設定正確的生成參數來避免這個問題。
已經預先匯入 tokenizer。
本練習屬於課程
Reinforcement Learning from Human Feedback(RLHF)
練習說明
- 將
top_k與min_length設為能幫助避免 KL 散度的數值。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}