设置奖励训练器
您的项目继续进行。现在已经有可用于开始训练奖励模型的 model 和 config 对象。
训练集和评估集已分别预加载为 train_data 和 eval_data。已从 trl 导入 RewardTrainer。
本练习是课程的一部分
来自人类反馈的强化学习(RLHF)
练习说明
- 通过为其属性指定模型、分词器、训练数据集、评估数据集和奖励配置,初始化
RewardTrainer()。
交互式实操练习
通过完成这段示例代码来试试这个练习。
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____