缓解负 KL 散度
您正在使用 RLHF 技术对模型进行微调,但发现模型表现较基线模型更差。您怀疑这是由负 KL 散度导致的,因此希望通过设置正确的生成参数来避免该问题。
已预先导入 tokenizer。
本练习是课程的一部分
来自人类反馈的强化学习(RLHF)
练习说明
- 将
top_k和min_length设为有助于避免 KL 散度的取值。
交互式实操练习
通过完成这段示例代码来试试这个练习。
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}