НачатьНачать бесплатно

Устранение отрицательной KL-дивергенции

Вы выполняли дообучение модели с помощью методов RLHF и заметили, что её производительность ухудшилась по сравнению с базовой моделью. Вы предполагаете, что причина — отрицательная KL-дивергенция, и хотите задать правильные параметры генерации, чтобы избежать этой проблемы.

tokenizer уже импортирован заранее.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Задайте значения top_k и min_length, которые помогут избежать KL-дивергенции.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Редактировать и запускать код