Bắt đầu ngayBắt đầu miễn phí

Huấn luyện, tinh chỉnh & phản hồi

Bạn đang tham gia một dự án phát triển mô hình sử dụng kỹ thuật Reinforcement Learning through Human Feedback (RLHF) để tối ưu hiệu năng trong môi trường hỗ trợ khách hàng.

Tùy chọn nào dưới đây mô tả chính xác nhất quy trình RLHF?

Bài tập này là một phần của khóa học

Các khái niệm về Large Language Models (LLMs)

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập