Пом'якшення негативної KL-дивергенції
Ви виконували донавчання моделі за методиками RLHF і помітили, що продуктивність моделі погіршилася порівняно з базовою. Ви підозрюєте, що це сталося через негативну KL-дивергенцію, тож хочете встановити правильні параметри генерації, щоб запобігти цій проблемі.
tokenizer уже імпортовано.
Ця вправа є частиною курсу
Reinforcement Learning from Human Feedback (RLHF)
Інструкції до вправи
- Встановіть
top_kіmin_lengthу значення, які допоможуть уникнути KL-дивергенції.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}