Bắt đầu ngayBắt đầu miễn phí

Kiểm tra reward model

Bạn quay lại tinh chỉnh mô hình và nhận thấy hiệu năng của mô hình vẫn kém hơn so với mô hình gốc. Lần này, bạn muốn kiểm tra reward model và bạn đã tạo một tập dữ liệu chứa các kết quả từ mô hình để phân tích. Bạn sẽ thực hiện những kiểm tra nào trên dữ liệu đầu ra?

Tập dữ liệu đã được nhập sẵn dưới tên reward_model_results.

Bài tập này là một phần của khóa học

Reinforcement Learning from Human Feedback (RLHF)

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập