ÎncepețiÎncepe gratuit

Configurarea trainerului de recompensă

Proiectul tău continuă și ai acum obiectele model și config pregătite pentru a începe antrenarea modelului de recompensă.

Seturile de date pentru antrenare și evaluare au fost preîncărcate ca train_data și eval_data. RewardTrainer a fost importat din trl.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează RewardTrainer() atribuind modelul, tokenizatorul, setul de date pentru antrenare, setul de date pentru evaluare și configurația de recompensă atributelor sale.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
Editează și rulează codul