开始使用免费开始使用

设置奖励训练器

您的项目继续进行。现在已经有可用于开始训练奖励模型的 modelconfig 对象。

训练集和评估集已分别预加载为 train_dataeval_data。已从 trl 导入 RewardTrainer

本练习是课程的一部分

来自人类反馈的强化学习(RLHF)

查看课程

练习说明

  • 通过为其属性指定模型、分词器、训练数据集、评估数据集和奖励配置,初始化 RewardTrainer()

交互式实操练习

通过完成这段示例代码来试试这个练习。

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
编辑并运行代码