Zmírnění negativní KL divergence
Při fine-tuningu modelu pomocí technik RLHF jsi zjistil/a, že jeho výkon se ve srovnání se základním modelem zhoršil. Příčinou by mohla být negativní KL divergence, proto chceš nastavit správné parametry generování, které tomuto problému zabrání.
tokenizer je již předem naimportován.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Nastav
top_kamin_lengthna hodnoty, které pomohou předejít KL divergenci.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}