ÎncepețiÎncepe gratuit

Inițializarea recompensei

Te afli în etapele finale ale implementării unui model generativ conceput pentru a oferi recomandări personalizate într-o librărie online. Pentru a alinia acest model cu recomandările preferate de utilizatori, trebuie să antrenezi un model de recompensă folosind date de preferință colectate. Primul pas este inițializarea modelului și a parametrilor de configurare.

AutoTokenizer și AutoModelForSequenceClassification au fost preîncărcate din transformers. RewardConfig a fost preîncărcat din trl.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă modelul GPT-1, "openai-gpt", pentru sarcina de clasificare a secvențelor, folosind AutoModelForSequenceClassification de la Hugging Face.
  • Inițializează configurația de recompensă folosind "output_dir" ca director de ieșire și setează lungimea maximă a tokenului la 60.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
Editează și rulează codul