Bắt đầu ngayBắt đầu miễn phí

Giảm thiểu phân kỳ KL âm

Bạn đang fine-tune mô hình bằng các kỹ thuật RLHF và nhận thấy hiệu suất của mô hình tệ hơn so với mô hình gốc. Bạn nghi ngờ nguyên nhân là do phân kỳ KL âm, nên muốn đặt các tham số sinh phù hợp để tránh vấn đề này.

tokenizer đã được nhập sẵn.

Bài tập này là một phần của khóa học

Reinforcement Learning from Human Feedback (RLHF)

Xem khóa học

Hướng dẫn bài tập

  • Đặt top_kmin_length về các giá trị giúp tránh phân kỳ KL.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Chỉnh sửa và Chạy Mã