เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การกำหนดค่าเริ่มต้นของ Reward

คุณอยู่ในขั้นตอนสุดท้ายของการ deploy โมเดล generative ที่ออกแบบมาเพื่อให้คำแนะนำเฉพาะบุคคลสำหรับร้านหนังสือออนไลน์ เพื่อให้โมเดลนี้สอดคล้องกับคำแนะนำที่มนุษย์ต้องการ จำเป็นต้องฝึก reward model โดยใช้ข้อมูล preference ที่รวบรวมไว้ ขั้นตอนแรกคือการกำหนดค่าเริ่มต้นให้กับโมเดลและพารามิเตอร์ต่างๆ

โหลด AutoTokenizer และ AutoModelForSequenceClassification จาก transformers และโหลด RewardConfig จาก trl ไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดโมเดล GPT-1 ชื่อ "openai-gpt" สำหรับงาน sequence classification โดยใช้ AutoModelForSequenceClassification ของ Hugging Face
  • กำหนดค่า reward configuration โดยใช้ "output_dir" เป็น output directory และตั้งค่าความยาวสูงสุดของ token เป็น 60

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
แก้ไขและรันโค้ด