Generarea de text cu RLHF
În acest exercițiu, vei lucra cu un model pre-antrenat cu RLHF numit lvwerra/gpt2-imdb-pos-v2. Este o oportunitate de a exersa construirea unui pipeline Hugging Face și de a-l folosi pentru a testa un caz de utilizare al modelelor antrenate cu RLHF: generarea de recenzii de filme.
Obiectele pipeline, AutoModelForCausalLM și AutoTokenizer au fost pre-importate din transformers. tokenizer-ul a fost pre-încărcat.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Setează numele modelului la
lvwerra/gpt2-imdb-pos-v2, modelul pre-antrenat cu RLHF. - Folosește funcția
pipelinepentru a crea un pipeline de tiptext-generation. - Folosește pipeline-ul de generare de text pentru a genera o continuare a recenziei furnizate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")