Zacznij terazZacznij za darmo

Konfiguracja trenera nagród

Projekt jest kontynuowany – masz już gotowe obiekty model i config, które pozwolą ci rozpocząć trenowanie modelu nagród.

Zbiory danych do trenowania i ewaluacji zostały wstępnie załadowane jako train_data i eval_data. Klasa RewardTrainer została zaimportowana z biblioteki trl.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Zainicjalizuj RewardTrainer(), przypisując do jego atrybutów: model, tokenizer, zbiór treningowy, zbiór ewaluacyjny oraz konfigurację nagrody.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
Edytuj i uruchom kod