Initiera PPO-tränaren
Du arbetar för ett kundtjänstföretag som använder en chattbot för att hantera kundförfrågningar. Chattboten ger hjälpsamma svar, men du har fått feedback om att de saknar djup. Nu behöver du finjustera modellen bakom chattboten, och du börjar med att skapa en instans av PPO-tränaren.
dataset_cs har redan laddats in.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Initiera PPO-konfigurationen med modellnamnet
"gpt2"och en inlärningshastighet på1.2e-5. - Läs in
AutoModelForCausalLMWithValueHead, den kausala språkmodellen med ett värde-huvud. - Skapa
PPOTrainer()med hjälp av modellen, konfigurationen och tokeniseraren du just definierat, samt den förinlästa datamängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____