НачатьНачать бесплатно

Инициализация PPO-тренера

Вы работаете в компании по обслуживанию клиентов, которая использует чат-бот для обработки обращений. Чат-бот даёт полезные ответы, однако недавно поступили отзывы о том, что им не хватает глубины. Вам нужно дообучить модель, лежащую в основе чат-бота, и вы начинаете с создания экземпляра PPO-тренера.

Набор данных dataset_cs уже загружен.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте конфигурацию PPO с названием модели "gpt2" и скоростью обучения 1.2e-5.
  • Загрузите AutoModelForCausalLMWithValueHead — причинно-следственную языковую модель с ценностной головой.
  • Создайте PPOTrainer(), передав ему только что определённые модель, конфигурацию и токенизатор, а также предварительно загруженный набор данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer

# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)

# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)

# Initialize PPO Trainer
ppo_trainer = ____
Редактировать и запускать код