ตั้งค่า Reward Trainer
โปรเจกต์ดำเนินต่อไป และตอนนี้มีออบเจกต์ model และ config พร้อมแล้วสำหรับการเริ่มต้นเทรน reward model
ชุดข้อมูลสำหรับการเทรนและการประเมินผลถูกโหลดไว้ล่วงหน้าเป็น train_data และ eval_data โดยมีการนำเข้า RewardTrainer จาก trl แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- สร้าง
RewardTrainer()โดยกำหนด model, tokenizer, ชุดข้อมูลสำหรับเทรน, ชุดข้อมูลสำหรับประเมินผล และการตั้งค่า reward ให้กับแอตทริบิวต์ที่เกี่ยวข้อง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)
# Initialize the reward trainer
trainer = ____