เริ่มต้น PPO trainer
คุณกำลังทำงานให้กับบริษัทบริการลูกค้าที่ใช้ chatbot รับมือกับคำถามของลูกค้า chatbot ตอบสนองได้อย่างมีประโยชน์ แต่ได้รับ feedback ว่าคำตอบยังขาดความลึก จึงจำเป็นต้อง fine-tune โมเดลที่อยู่เบื้องหลัง chatbot โดยเริ่มจากการสร้าง PPO trainer instance
โหลด dataset_cs ไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- เริ่มต้น PPO configuration โดยใช้ชื่อโมเดลว่า
"gpt2"และกำหนด learning rate เป็น1.2e-5 - โหลด
AutoModelForCausalLMWithValueHeadซึ่งเป็น causal language model ที่มี value head - สร้าง
PPOTrainer()โดยใช้โมเดล, configuration และ tokenizer ที่กำหนดไว้ พร้อมกับชุดข้อมูลที่โหลดไว้แล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____