Zacznij terazZacznij za darmo

Łagodzenie negatywnej dywergencji KL

Podczas dostrajania modelu technikami RLHF zauważono, że jego wydajność pogorszyła się w porównaniu z modelem bazowym. Podejrzewasz, że przyczyną jest negatywna dywergencja KL, dlatego chcesz ustawić odpowiednie parametry generowania, aby zapobiec temu problemowi.

tokenizer został wcześniej zaimportowany.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Ustaw top_k i min_length na wartości, które pomagają uniknąć dywergencji KL.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Edytuj i uruchom kod