การฝึก การปรับแต่ง และการให้ข้อเสนอแนะ
สมมติว่ากำลังพัฒนาโมเดลโดยใช้เทคนิค Reinforcement Learning through Human Feedback (RLHF) เพื่อเพิ่มประสิทธิภาพในการสนับสนุนลูกค้า
ตัวเลือกใดต่อไปนี้อธิบายกระบวนการ RLHF ได้ถูกต้องที่สุด?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนวคิดของ Large Language Models (LLMs)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด