Huấn luyện, tinh chỉnh & phản hồi
Bạn đang tham gia một dự án phát triển mô hình sử dụng kỹ thuật Reinforcement Learning through Human Feedback (RLHF) để tối ưu hiệu năng trong môi trường hỗ trợ khách hàng.
Tùy chọn nào dưới đây mô tả chính xác nhất quy trình RLHF?
Bài tập này là một phần của khóa học
Các khái niệm về Large Language Models (LLMs)
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập