เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ตั้งค่า Reward Trainer

โปรเจกต์ดำเนินต่อไป และตอนนี้มีออบเจกต์ model และ config พร้อมแล้วสำหรับการเริ่มต้นเทรน reward model

ชุดข้อมูลสำหรับการเทรนและการประเมินผลถูกโหลดไว้ล่วงหน้าเป็น train_data และ eval_data โดยมีการนำเข้า RewardTrainer จาก trl แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง RewardTrainer() โดยกำหนด model, tokenizer, ชุดข้อมูลสำหรับเทรน, ชุดข้อมูลสำหรับประเมินผล และการตั้งค่า reward ให้กับแอตทริบิวต์ที่เกี่ยวข้อง

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
model = AutoModelForSequenceClassification.from_pretrained('openai-gpt')
config = RewardConfig(output_dir='output_dir', max_length=60)

# Initialize the reward trainer
trainer = ____
แก้ไขและรันโค้ด