การลด KL divergence ที่ติดลบ
คุณกำลัง fine-tune โมเดลด้วยเทคนิค RLHF และสังเกตว่าประสิทธิภาพของโมเดลลดลงเมื่อเทียบกับโมเดลพื้นฐาน คุณสงสัยว่าปัญหานี้เกิดจาก KL divergence ที่ติดลบ จึงต้องการตั้งค่าพารามิเตอร์การสร้างผลลัพธ์ให้ถูกต้องเพื่อป้องกันปัญหาดังกล่าว
tokenizer ถูกนำเข้าไว้ล่วงหน้าแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- ตั้งค่า
top_kและmin_lengthให้เหมาะสมเพื่อหลีกเลี่ยง KL divergence
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}