Inițializarea recompensei
Te afli în etapele finale ale implementării unui model generativ conceput pentru a oferi recomandări personalizate într-o librărie online. Pentru a alinia acest model cu recomandările preferate de utilizatori, trebuie să antrenezi un model de recompensă folosind date de preferință colectate. Primul pas este inițializarea modelului și a parametrilor de configurare.
AutoTokenizer și AutoModelForSequenceClassification au fost preîncărcate din transformers. RewardConfig a fost preîncărcat din trl.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Încarcă modelul GPT-1,
"openai-gpt", pentru sarcina de clasificare a secvențelor, folosindAutoModelForSequenceClassificationde la Hugging Face. - Inițializează configurația de recompensă folosind
"output_dir"ca director de ieșire și setează lungimea maximă a tokenului la60.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)