Nastavení reward traineru
Projekt pokračuje a teď máš připravené objekty model a config, takže můžeš začít trénovat reward model.
Trénovací a evaluační datasety jsou předem načteny jako train_data a eval_data. RewardTrainer byl importován z knihovny trl.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Inicializuj
RewardTrainer()tak, že jeho atributům přiřadíš model, tokenizer, trénovací dataset, evaluační dataset a konfiguraci odměny.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____