การกำหนดค่าเริ่มต้นของ Reward
คุณอยู่ในขั้นตอนสุดท้ายของการ deploy โมเดล generative ที่ออกแบบมาเพื่อให้คำแนะนำเฉพาะบุคคลสำหรับร้านหนังสือออนไลน์ เพื่อให้โมเดลนี้สอดคล้องกับคำแนะนำที่มนุษย์ต้องการ จำเป็นต้องฝึก reward model โดยใช้ข้อมูล preference ที่รวบรวมไว้ ขั้นตอนแรกคือการกำหนดค่าเริ่มต้นให้กับโมเดลและพารามิเตอร์ต่างๆ
โหลด AutoTokenizer และ AutoModelForSequenceClassification จาก transformers และโหลด RewardConfig จาก trl ไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- โหลดโมเดล GPT-1 ชื่อ
"openai-gpt"สำหรับงาน sequence classification โดยใช้AutoModelForSequenceClassificationของ Hugging Face - กำหนดค่า reward configuration โดยใช้
"output_dir"เป็น output directory และตั้งค่าความยาวสูงสุดของ token เป็น60
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)