Устранение отрицательной KL-дивергенции
Вы выполняли дообучение модели с помощью методов RLHF и заметили, что её производительность ухудшилась по сравнению с базовой моделью. Вы предполагаете, что причина — отрицательная KL-дивергенция, и хотите задать правильные параметры генерации, чтобы избежать этой проблемы.
tokenizer уже импортирован заранее.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Задайте значения
top_kиmin_length, которые помогут избежать KL-дивергенции.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}