开始使用免费开始使用

初始化 PPO 训练器

您在一家客服公司工作,使用聊天机器人处理客户咨询。该机器人能提供有用的回复,但您最近收到反馈,认为回复深度不够。您需要对支撑该机器人的模型进行微调,首先从创建一个 PPO 训练器实例开始。

dataset_cs 已经加载完成。

本练习是课程的一部分

来自人类反馈的强化学习(RLHF)

查看课程

练习说明

  • 使用模型名称 "gpt2" 和学习率 1.2e-5 初始化 PPO 配置。
  • 加载带有 value head 的自回归语言模型 AutoModelForCausalLMWithValueHead
  • 使用刚刚定义的模型、配置和分词器,并结合预加载的数据集,创建 PPOTrainer()

交互式实操练习

通过完成这段示例代码来试试这个练习。

from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer

# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)

# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)

# Initialize PPO Trainer
ppo_trainer = ____
编辑并运行代码