Textgenerering med RLHF
I den här övningen arbetar du med en modell som förtränade med RLHF vid namn lvwerra/gpt2-imdb-pos-v2. Övningen ger dig tillfälle att repetera hur man bygger en Hugging Face-pipeline och använda den för att testa ett användningsfall för RLHF-tränade modeller: att generera filmrecensioner.
Objekten pipeline, AutoModelForCausalLM, and AutoTokenizer har importerats i förväg från transformers. tokenizer har laddats in i förväg.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Ange modellnamnet till
lvwerra/gpt2-imdb-pos-v2, den RLHF-förtränade modellen. - Använd funktionen
pipelineför att skapa entext-generation-pipeline. - Använd textgenereringspipelinen för att generera en fortsättning på den angivna recensionen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")