เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ตรวจสอบโมเดลรางวัล

คุณกลับมาปรับแต่งโมเดลอีกครั้งและพบว่าประสิทธิภาพยังคงด้อยกว่าโมเดลพื้นฐาน คราวนี้จึงต้องการตรวจสอบโมเดลรางวัล และได้เตรียมชุดข้อมูลที่มีผลลัพธ์จากโมเดลไว้สำหรับวิเคราะห์ จะทำการตรวจสอบอะไรบ้างกับข้อมูลผลลัพธ์นี้?

ชุดข้อมูลถูกนำเข้าไว้แล้วในชื่อ reward_model_results

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง

เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา

เริ่มแบบฝึกหัด