ÎncepețiÎncepe gratuit

Inițializează antrenorul PPO

Lucrezi pentru o companie de servicii pentru clienți care folosește un chatbot pentru a gestiona solicitările primite. Chatbot-ul oferă răspunsuri utile, însă ai primit recent feedback că acestea nu au suficientă profunzime. Trebuie să ajustezi fin modelul din spatele chatbot-ului, iar primul pas este crearea unei instanțe de antrenor PPO.

Setul de date dataset_cs a fost deja încărcat.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează configurația PPO cu numele de model "gpt2" și o rată de învățare de 1.2e-5.
  • Încarcă AutoModelForCausalLMWithValueHead, modelul de limbaj cauzal cu un cap de valoare.
  • Creează PPOTrainer() folosind modelul, configurația și tokenizer-ul tocmai definite, împreună cu setul de date preîncărcat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer

# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)

# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)

# Initialize PPO Trainer
ppo_trainer = ____
Editează și rulează codul