Настройка тренера модели вознаграждения
Проект продолжается: объекты model и config готовы, и можно приступать к обучению модели вознаграждения.
Наборы данных для обучения и оценки предварительно загружены как train_data и eval_data. Класс RewardTrainer импортирован из trl.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Инициализируйте
RewardTrainer(), передав ему модель, токенизатор, обучающий набор данных, набор данных для оценки и конфигурацию вознаграждения в соответствующих атрибутах.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____