ПочатиПочніть безкоштовно

Пом'якшення негативної KL-дивергенції

Ви виконували донавчання моделі за методиками RLHF і помітили, що продуктивність моделі погіршилася порівняно з базовою. Ви підозрюєте, що це сталося через негативну KL-дивергенцію, тож хочете встановити правильні параметри генерації, щоб запобігти цій проблемі.

tokenizer уже імпортовано.

Ця вправа є частиною курсу

Reinforcement Learning from Human Feedback (RLHF)

Переглянути курс

Інструкції до вправи

  • Встановіть top_k і min_length у значення, які допоможуть уникнути KL-дивергенції.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Редагувати та запускати код