Łagodzenie negatywnej dywergencji KL
Podczas dostrajania modelu technikami RLHF zauważono, że jego wydajność pogorszyła się w porównaniu z modelem bazowym. Podejrzewasz, że przyczyną jest negatywna dywergencja KL, dlatego chcesz ustawić odpowiednie parametry generowania, aby zapobiec temu problemowi.
tokenizer został wcześniej zaimportowany.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Ustaw
top_kimin_lengthna wartości, które pomagają uniknąć dywergencji KL.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}