Giảm thiểu phân kỳ KL âm
Bạn đang fine-tune mô hình bằng các kỹ thuật RLHF và nhận thấy hiệu suất của mô hình tệ hơn so với mô hình gốc. Bạn nghi ngờ nguyên nhân là do phân kỳ KL âm, nên muốn đặt các tham số sinh phù hợp để tránh vấn đề này.
tokenizer đã được nhập sẵn.
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Đặt
top_kvàmin_lengthvề các giá trị giúp tránh phân kỳ KL.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}