เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การลด KL divergence ที่ติดลบ

คุณกำลัง fine-tune โมเดลด้วยเทคนิค RLHF และสังเกตว่าประสิทธิภาพของโมเดลลดลงเมื่อเทียบกับโมเดลพื้นฐาน คุณสงสัยว่าปัญหานี้เกิดจาก KL divergence ที่ติดลบ จึงต้องการตั้งค่าพารามิเตอร์การสร้างผลลัพธ์ให้ถูกต้องเพื่อป้องกันปัญหาดังกล่าว

tokenizer ถูกนำเข้าไว้ล่วงหน้าแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ตั้งค่า top_k และ min_length ให้เหมาะสมเพื่อหลีกเลี่ยง KL divergence

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
แก้ไขและรันโค้ด