Configurarea trainerului de recompensă
Proiectul tău continuă și ai acum obiectele model și config pregătite pentru a începe antrenarea modelului de recompensă.
Seturile de date pentru antrenare și evaluare au fost preîncărcate ca train_data și eval_data. RewardTrainer a fost importat din trl.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Inițializează
RewardTrainer()atribuind modelul, tokenizatorul, setul de date pentru antrenare, setul de date pentru evaluare și configurația de recompensă atributelor sale.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____