Konfiguracja trenera nagród
Projekt jest kontynuowany – masz już gotowe obiekty model i config, które pozwolą ci rozpocząć trenowanie modelu nagród.
Zbiory danych do trenowania i ewaluacji zostały wstępnie załadowane jako train_data i eval_data. Klasa RewardTrainer została zaimportowana z biblioteki trl.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Zainicjalizuj
RewardTrainer(), przypisując do jego atrybutów: model, tokenizer, zbiór treningowy, zbiór ewaluacyjny oraz konfigurację nagrody.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____