Začněte nyníZačněte zdarma

Nastavení reward traineru

Projekt pokračuje a teď máš připravené objekty model a config, takže můžeš začít trénovat reward model.

Trénovací a evaluační datasety jsou předem načteny jako train_data a eval_data. RewardTrainer byl importován z knihovny trl.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Inicializuj RewardTrainer() tak, že jeho atributům přiřadíš model, tokenizer, trénovací dataset, evaluační dataset a konfiguraci odměny.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
Upravit a spustit kód