Inițializează antrenorul PPO
Lucrezi pentru o companie de servicii pentru clienți care folosește un chatbot pentru a gestiona solicitările primite. Chatbot-ul oferă răspunsuri utile, însă ai primit recent feedback că acestea nu au suficientă profunzime. Trebuie să ajustezi fin modelul din spatele chatbot-ului, iar primul pas este crearea unei instanțe de antrenor PPO.
Setul de date dataset_cs a fost deja încărcat.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Inițializează configurația PPO cu numele de model
"gpt2"și o rată de învățare de1.2e-5. - Încarcă
AutoModelForCausalLMWithValueHead, modelul de limbaj cauzal cu un cap de valoare. - Creează
PPOTrainer()folosind modelul, configurația și tokenizer-ul tocmai definite, împreună cu setul de date preîncărcat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____