시작하기무료로 시작하기

Reward Trainer 설정하기

프로젝트를 계속 진행하면서 이제 보상 모델 학습을 시작할 준비가 된 modelconfig 객체가 준비되어 있어요.

학습 및 평가 데이터셋은 각각 train_dataeval_data로 미리 로드되어 있습니다. RewardTrainertrl에서 이미 가져왔어요.

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

연습 안내

  • 모델, 토크나이저, 학습 데이터셋, 평가 데이터셋, 보상 구성을 속성으로 지정해 RewardTrainer()를 초기화하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
코드 편집 및 실행