เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

เริ่มต้น PPO trainer

คุณกำลังทำงานให้กับบริษัทบริการลูกค้าที่ใช้ chatbot รับมือกับคำถามของลูกค้า chatbot ตอบสนองได้อย่างมีประโยชน์ แต่ได้รับ feedback ว่าคำตอบยังขาดความลึก จึงจำเป็นต้อง fine-tune โมเดลที่อยู่เบื้องหลัง chatbot โดยเริ่มจากการสร้าง PPO trainer instance

โหลด dataset_cs ไว้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เริ่มต้น PPO configuration โดยใช้ชื่อโมเดลว่า "gpt2" และกำหนด learning rate เป็น 1.2e-5
  • โหลด AutoModelForCausalLMWithValueHead ซึ่งเป็น causal language model ที่มี value head
  • สร้าง PPOTrainer() โดยใช้โมเดล, configuration และ tokenizer ที่กำหนดไว้ พร้อมกับชุดข้อมูลที่โหลดไว้แล้ว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer

# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)

# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)

# Initialize PPO Trainer
ppo_trainer = ____
แก้ไขและรันโค้ด