Kom igångKom igång gratis

Initierar belöningen

Du befinner dig i slutskedet av att driftsätta en generativ modell som ska erbjuda personliga rekommendationer för en nätbokhandel. För att anpassa modellen till mänskligt föredragna rekommendationer behöver du träna en belöningsmodell med hjälp av insamlad preferensdata. Det första steget är att initiera modellen och konfigurationsparametrarna.

AutoTokenizer och AutoModelForSequenceClassification förinstallerades från transformers. RewardConfig förinstallerades från trl.

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Läs in GPT-1-modellen, "openai-gpt", för sekvensklassificeringsuppgiften med hjälp av Hugging Face:s AutoModelForSequenceClassification.
  • Initiera belöningskonfigurationen med "output_dir" som utdatakatalog och ange den maximala tokenlängden till 60.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
Redigera och kör kod