Инициализация PPO-тренера
Вы работаете в компании по обслуживанию клиентов, которая использует чат-бот для обработки обращений. Чат-бот даёт полезные ответы, однако недавно поступили отзывы о том, что им не хватает глубины. Вам нужно дообучить модель, лежащую в основе чат-бота, и вы начинаете с создания экземпляра PPO-тренера.
Набор данных dataset_cs уже загружен.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Инициализируйте конфигурацию PPO с названием модели
"gpt2"и скоростью обучения1.2e-5. - Загрузите
AutoModelForCausalLMWithValueHead— причинно-следственную языковую модель с ценностной головой. - Создайте
PPOTrainer(), передав ему только что определённые модель, конфигурацию и токенизатор, а также предварительно загруженный набор данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____