Kom igångKom igång gratis

Konfigurera belöningströning

Ditt projekt fortsätter och du har nu objekten model och config redo för att börja träna belöningsmodellen.

Tränings- och utvärderingsdatamängderna har förinslästs som train_data och eval_data. RewardTrainer har importerats från trl.

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Initiera RewardTrainer() genom att tilldela modellen, tokeniseraren, träningsdatamängden, utvärderingsdatamängden och belöningskonfigurationen till dess attribut.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
Redigera och kör kod