開始使用免費開始

降低負向 KL 散度的影響

你正在使用 RLHF 技術微調模型,但發現模型的表現比基礎模型更差。你懷疑原因是負向 KL 散度,因此想設定正確的生成參數來避免這個問題。

已經預先匯入 tokenizer

本練習屬於課程

Reinforcement Learning from Human Feedback(RLHF)

檢視課程

練習說明

  • top_kmin_length 設為能幫助避免 KL 散度的數值。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
編輯並執行程式碼