การสร้างข้อความด้วย RLHF
ในแบบฝึกหัดนี้ จะได้ทำงานกับโมเดลที่ผ่านการเทรนล่วงหน้าด้วย RLHF ชื่อ lvwerra/gpt2-imdb-pos-v2 แบบฝึกหัดนี้เป็นโอกาสทบทวนการสร้าง Hugging Face pipeline และนำไปใช้ทดสอบกรณีการใช้งานของโมเดลที่เทรนด้วย RLHF: การสร้างรีวิวภาพยนตร์
ออบเจกต์ pipeline, AutoModelForCausalLM, and AutoTokenizer ได้ถูก import มาจาก transformers ล่วงหน้าแล้ว และ tokenizer ได้ถูกโหลดไว้เรียบร้อยแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- กำหนดชื่อโมเดลเป็น
lvwerra/gpt2-imdb-pos-v2ซึ่งเป็นโมเดลที่เทรนล่วงหน้าด้วย RLHF - ใช้ฟังก์ชัน
pipelineเพื่อสร้าง pipeline แบบtext-generation - ใช้ text generation pipeline เพื่อสร้างข้อความต่อเนื่องจากรีวิวที่กำหนดให้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")