Konfigurera belöningströning
Ditt projekt fortsätter och du har nu objekten model och config redo för att börja träna belöningsmodellen.
Tränings- och utvärderingsdatamängderna har förinslästs som train_data och eval_data. RewardTrainer har importerats från trl.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Initiera
RewardTrainer()genom att tilldela modellen, tokeniseraren, träningsdatamängden, utvärderingsdatamängden och belöningskonfigurationen till dess attribut.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____