ตรวจสอบโมเดลรางวัล
คุณกลับมาปรับแต่งโมเดลอีกครั้งและพบว่าประสิทธิภาพยังคงด้อยกว่าโมเดลพื้นฐาน คราวนี้จึงต้องการตรวจสอบโมเดลรางวัล และได้เตรียมชุดข้อมูลที่มีผลลัพธ์จากโมเดลไว้สำหรับวิเคราะห์ จะทำการตรวจสอบอะไรบ้างกับข้อมูลผลลัพธ์นี้?
ชุดข้อมูลถูกนำเข้าไว้แล้วในชื่อ reward_model_results
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด