Initierar belöningen
Du befinner dig i slutskedet av att driftsätta en generativ modell som ska erbjuda personliga rekommendationer för en nätbokhandel. För att anpassa modellen till mänskligt föredragna rekommendationer behöver du träna en belöningsmodell med hjälp av insamlad preferensdata. Det första steget är att initiera modellen och konfigurationsparametrarna.
AutoTokenizer och AutoModelForSequenceClassification förinstallerades från transformers. RewardConfig förinstallerades från trl.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Läs in GPT-1-modellen,
"openai-gpt", för sekvensklassificeringsuppgiften med hjälp av Hugging Face:sAutoModelForSequenceClassification. - Initiera belöningskonfigurationen med
"output_dir"som utdatakatalog och ange den maximala tokenlängden till60.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)