НачатьНачать бесплатно

Настройка тренера модели вознаграждения

Проект продолжается: объекты model и config готовы, и можно приступать к обучению модели вознаграждения.

Наборы данных для обучения и оценки предварительно загружены как train_data и eval_data. Класс RewardTrainer импортирован из trl.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте RewardTrainer(), передав ему модель, токенизатор, обучающий набор данных, набор данных для оценки и конфигурацию вознаграждения в соответствующих атрибутах.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
Редактировать и запускать код